超越短片段:基于协作记忆的端到端视频级学习
计算机视觉与模式识别
2021-04-06 v1
摘要
训练视频模型的标准方式是在每次迭代中从视频采样单个片段,并针对视频级标签优化该片段的预测。我们认为,单个片段可能不具备足够的时间覆盖以展现待识别的标签,因为视频数据集通常仅以类别信息弱标注,而无密集时间标注。此外,在短暂片段上优化模型会妨碍其学习长期时间依赖的能力。为克服这些局限,我们引入一种协作记忆机制,在每次训练迭代中对一个视频的多个采样片段的信息进行编码。这使得超越单个片段的长程依赖学习成为可能。我们探索了协作记忆的不同设计选择以缓解优化困难。我们提出的框架可端到端训练,并以可忽略的计算开销显著提升了视频分类精度。通过大量实验,我们证明该框架可泛化至不同视频架构与任务,在动作识别(如 Kinetics-400 与 700、Charades、Something-Something-V1)和动作检测(如 AVA v2.1 与 v2.2)上均优于最先进水平。
引用
@article{arxiv.2104.01198,
title = {Beyond Short Clips: End-to-End Video-Level Learning with Collaborative Memories},
author = {Xitong Yang and Haoqi Fan and Lorenzo Torresani and Larry Davis and Heng Wang},
journal= {arXiv preprint arXiv:2104.01198},
year = {2021}
}
备注
CVPR 2021