中文

小规模下用于视频识别的运动增强自训练

计算机视觉与模式识别 2021-05-05 v1

摘要

本文的目标是在无标签视频集合上自训练一个 3D 卷积神经网络,以部署于小规模视频集合。由于较小的视频数据集从运动中比从外观中获益更多,我们努力使用光流训练我们的网络,但在推理时避免计算光流。我们提出首个运动增强自训练机制,称为 MotionFit。我们从小规模且有标签的视频集合上监督训练一个运动模型开始。利用该运动模型,我们为大型无标签视频集合生成伪标签,这使我们能够通过学习用外观模型预测这些伪标签来迁移知识。此外,我们引入多片段损失作为一种简单而高效的方法来提高伪标签的质量,即使无需额外的辅助任务。我们还在外观模型的自训练过程中考虑了视频的时间粒度,这是以往工作所忽略的。结果,我们获得了一个适用于动作识别和片段检索等视频下游任务的强运动增强表示模型。在小规模视频数据集上,MotionFit 在使用相同数量类标签的情况下,优于知识迁移替代方案 5%–8%,优于纯视频自监督 1%–7%,优于半监督学习 9%–18%。

关键词

引用

@article{arxiv.2105.01646,
  title  = {Motion-Augmented Self-Training for Video Recognition at Smaller Scale},
  author = {Kirill Gavrilyuk and Mihir Jain and Ilia Karmanov and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:2105.01646},
  year   = {2021}
}