中文

用于视频目标检测的印象网络

计算机视觉与模式识别 2017-12-19 v1

摘要

相较于图像目标检测,视频目标检测更具挑战性。先前的研究证明逐帧应用目标检测器不仅缓慢而且不准确。视觉线索因散焦与运动模糊而减弱,导致对应帧上的检测失败。多帧特征融合方法被证明能有效提升准确率,但却极大牺牲了速度。基于特征传播的方法被证明能有效提升速度,但却牺牲了准确率。那么,是否有可能同时提升速度与性能?受人类利用印象从模糊帧中识别物体的启发,我们提出了体现一种自然且高效的特征聚合机制的印象网络(Impression Network)。在我们的框架中,印象特征通过迭代吸收稀疏提取的帧特征而建立。该印象特征沿视频全程传播,帮助增强低质量帧的特征。这一印象机制使得在以极小开销在稀疏关键帧间进行长程多帧特征融合成为可能。它在 ImageNet VID 上显著改善了逐帧检测基线,同时快 3 倍(20 fps)。我们希望印象网络能为视频特征增强提供新视角。代码将公开。

关键词

引用

@article{arxiv.1712.05896,
  title  = {Impression Network for Video Object Detection},
  author = {Congrui Hetang and Hongwei Qin and Shaohui Liu and Junjie Yan},
  journal= {arXiv preprint arXiv:1712.05896},
  year   = {2017}
}

备注

Tech Report