中文

用于视频目标检测的流引导特征聚合

计算机视觉与模式识别 2017-08-21 v2

摘要

将最先进的目标检测器从图像扩展到视频是具有挑战性的。检测精度受到视频中目标外观退化的影响,例如运动模糊、视频散焦、罕见姿态等。现有工作试图在边界框层面上利用时间信息,但此类方法并非端到端训练。我们提出流引导特征聚合,一个准确且端到端学习的视频目标检测框架。它转而利用特征层面的时间相干性。它通过沿运动路径聚合邻近特征来改进每帧特征,从而提高视频识别精度。我们的方法在 ImageNet VID 上显著优于强大的单帧基线,尤其是对于更具挑战性的快速运动目标。我们的框架是原理性的,且与赢得 2016 年 ImageNet VID 挑战赛的最佳工程系统相当,无需额外的花哨技巧。所提出的方法与 Deep Feature Flow 一起,支撑了 2017 年 ImageNet VID 挑战赛的获胜方案。代码可在 https://github.com/msracver/Flow-Guided-Feature-Aggregation 获取。

关键词

引用

@article{arxiv.1703.10025,
  title  = {Flow-Guided Feature Aggregation for Video Object Detection},
  author = {Xizhou Zhu and Yujie Wang and Jifeng Dai and Lu Yuan and Yichen Wei},
  journal= {arXiv preprint arXiv:1703.10025},
  year   = {2017}
}