中文

基于时空上下文聚合的视频目标检测

计算机视觉与模式识别 2019-07-12 v1

摘要

近期视频目标检测的前沿特征聚合范式依赖于推断特征对应。由于图像质量差、运动模糊等,特征对应估计问题本质上困难,且估计结果不稳定。为避免该问题,我们提出一种简单而有效的在目标提议级别上操作的特征聚合框架。它通过学习帧内及相邻帧间目标提议的语义与时空关系来增强每个提议的特征。实验在 ImageNet VID 数据集上进行。无需任何额外技巧,我们的方法在 ImageNet VID 数据集上取得 80.3% mAP,优于先前最优方法。所提特征聚合机制将单帧 Faster RCNN 基线提升 5.8% mAP。此外,在无时间后处理设置下,我们的方法以 1.4% mAP 优于先前最优。

关键词

引用

@article{arxiv.1907.04988,
  title  = {Object Detection in Video with Spatial-temporal Context Aggregation},
  author = {Hao Luo and Lichao Huang and Han Shen and Yuan Li and Chang Huang and Xinggang Wang},
  journal= {arXiv preprint arXiv:1907.04988},
  year   = {2019}
}