STAT: 迈向可泛化的时序动作定位
计算机视觉与模式识别
2024-04-23 v1
摘要
弱监督时序动作定位旨在仅使用视频级标签识别和定位动作实例。尽管取得了显著进展,现有方法在迁移到不同分布时性能严重下降,因此难以适应真实场景。为解决此问题,我们提出了可泛化时序动作定位任务(GTAL),专注于提高动作定位方法的泛化能力。我们观察到性能下降主要归因于对不同动作尺度的泛化能力不足。为解决此问题,我们提出STAT(自监督时序自适应教师),利用教师-学生结构进行迭代细化。我们的STAT具有细化模块和对齐模块。前者通过利用上下文信息迭代细化模型输出,帮助适应目标尺度。后者通过促进学生和教师模型之间的一致性来改进细化过程。我们在三个数据集THUMOS14、ActivityNet1.2和HACS上进行了大量实验,结果表明我们的方法在跨分布评估设置下显著改进了基线方法,甚至接近同分布评估性能。
引用
@article{arxiv.2404.13311,
title = {STAT: Towards Generalizable Temporal Action Localization},
author = {Yangcen Liu and Ziyi Liu and Yuanhao Zhai and Wen Li and David Doerman and Junsong Yuan},
journal= {arXiv preprint arXiv:2404.13311},
year = {2024}
}
备注
14 pages, LaTeX;