中文

STAT: 迈向可泛化的时序动作定位

计算机视觉与模式识别 2024-04-23 v1

摘要

弱监督时序动作定位旨在仅使用视频级标签识别和定位动作实例。尽管取得了显著进展,现有方法在迁移到不同分布时性能严重下降,因此难以适应真实场景。为解决此问题,我们提出了可泛化时序动作定位任务(GTAL),专注于提高动作定位方法的泛化能力。我们观察到性能下降主要归因于对不同动作尺度的泛化能力不足。为解决此问题,我们提出STAT(自监督时序自适应教师),利用教师-学生结构进行迭代细化。我们的STAT具有细化模块和对齐模块。前者通过利用上下文信息迭代细化模型输出,帮助适应目标尺度。后者通过促进学生和教师模型之间的一致性来改进细化过程。我们在三个数据集THUMOS14、ActivityNet1.2和HACS上进行了大量实验,结果表明我们的方法在跨分布评估设置下显著改进了基线方法,甚至接近同分布评估性能。

关键词

引用

@article{arxiv.2404.13311,
  title  = {STAT: Towards Generalizable Temporal Action Localization},
  author = {Yangcen Liu and Ziyi Liu and Yuanhao Zhai and Wen Li and David Doerman and Junsong Yuan},
  journal= {arXiv preprint arXiv:2404.13311},
  year   = {2024}
}

备注

14 pages, LaTeX;