中文

上下文至关重要:利用循环神经网络细化视频中的目标检测

计算机视觉与模式识别 2016-07-20 v2

摘要

鉴于网上有海量的视频,以及静态图像目标检测的最新突破,视频中的目标检测提供了一个充满希望的新前沿。然而,运动模糊和压缩伪差会导致严重的帧级变异性,即使在肉眼看来很平滑的视频中也是如此。此外,视频数据集往往具有稀疏标注的帧。我们提出了一个用于改进视频中目标检测的新框架,该框架捕获时间上下文并鼓励预测的一致性。首先,我们训练一个伪标注器,即一个用于目标检测的领域自适应卷积神经网络。伪标注器首先在标注帧的子集上单独训练,然后应用于所有帧。然后我们训练一个循环神经网络,它以伪标注帧序列作为输入,并优化一个既鼓励在目标帧上的准确性又鼓励在连续帧之间的一致性的目标函数。该方法结合了对目标帧的强监督、对上下文帧的弱监督以及通过平滑性惩罚进行的正则化。我们的方法在 Youtube-Video Objects 数据集上实现了 68.73 的平均精度均值(mAP),比最强的基于图像的基线提高了 7.1。我们的实验表明,相邻帧可以提供有价值的信息,即使没有标签。

关键词

引用

@article{arxiv.1607.04648,
  title  = {Context Matters: Refining Object Detection in Video with Recurrent Neural Networks},
  author = {Subarna Tripathi and Zachary C. Lipton and Serge Belongie and Truong Nguyen},
  journal= {arXiv preprint arXiv:1607.04648},
  year   = {2016}
}

备注

To appear in BMVC 2016