面向长视频动作识别的弱监督端到端学习
计算机视觉与模式识别
2024-05-27 v2
摘要
在长视频上开发端到端动作识别模型对于长视频动作理解是基础且关键的。由于在整个长视频上端到端训练的成本难以承受,现有工作通常在从长视频中裁剪出的短片段上训练模型。然而,这种“先裁剪再训练”的做法需要用于片段级监督的动作区间标注,即知道哪些动作被裁剪进了片段。不幸的是,收集此类标注非常昂贵,并阻碍了模型的大规模训练。为此,本工作旨在构建一个弱监督端到端框架,用于在长视频上仅以视频级动作类别标签训练识别模型。在不知晓长视频中动作精确时间位置的情况下,我们提出的弱监督框架AdaptFocus估计动作发生的位置与可能性,以自适应聚焦于信息丰富的动作片段进行端到端训练。所提AdaptFocus框架的有效性在三个长视频数据集上得到验证。此外,对于下游长视频任务,我们的AdaptFocus框架提供了一种弱监督特征提取流程,用于提取更鲁棒的长视频特征,从而显著推进下游任务上最先进方法的性能。我们将发布代码与模型。
引用
@article{arxiv.2311.17118,
title = {Towards Weakly Supervised End-to-end Learning for Long-video Action Recognition},
author = {Jiaming Zhou and Hanjun Li and Kun-Yu Lin and Junwei Liang},
journal= {arXiv preprint arXiv:2311.17118},
year = {2024}
}