中文

探索用于视频识别的时间动态数据增强

计算机视觉与模式识别 2022-07-01 v1

摘要

数据增强近来已成为视觉识别任务现代训练方案中的重要组成部分。然而,尽管数据增强有效,其在视频识别中的应用却鲜有探索。现有少数视频识别增强方案朴素地将图像增强方法扩展到整个视频帧上施加相同操作。我们的核心思想是,每帧增强操作的强度需随时间改变以捕捉真实世界视频的时间变化。这些变化应在训练中以更少的额外超参数尽可能多样地生成。受此启发,我们提出了一种简单而有效的视频数据增强框架 DynaAugment。每帧上增强操作的强度通过一种有效机制——傅里叶采样(Fourier Sampling)来改变,该机制参数化了多样、平滑且真实的时间变化。DynaAugment 还包含适用于视频的扩展搜索空间以用于自动数据增强方法。DynaAugment 通过实验证明,在多样视频模型上,相较于静态增强仍有额外的性能提升空间。具体而言,我们在各种视频数据集与任务上展示了 DynaAugment 的有效性:大规模视频识别(Kinetics-400 和 Something-Something-v2)、小规模视频识别(UCF-101 和 HMDB-51)、细粒度视频识别(Diving-48 和 FineGym)、Breakfast 上的视频动作分割、THUMOS'14 上的视频动作定位,以及 MOT17Det 上的视频目标检测。DynaAugment 还使视频模型学习到更通用的表征,从而提升其在损坏视频上的鲁棒性。

关键词

引用

@article{arxiv.2206.15015,
  title  = {Exploring Temporally Dynamic Data Augmentation for Video Recognition},
  author = {Taeoh Kim and Jinhyung Kim and Minho Shim and Sangdoo Yun and Myunggu Kang and Dongyoon Wee and Sangyoun Lee},
  journal= {arXiv preprint arXiv:2206.15015},
  year   = {2022}
}

备注

Technical Report