中文

基于长短期特征聚合的压缩视频实时精确目标检测

计算机视觉与模式识别 2021-03-29 v1

摘要

视频目标检测是计算机视觉中的基础问题,具有广泛的应用。基于深度网络,视频目标检测正被积极研究以推进检测速度与精度的极限。为降低计算成本,我们在视频中稀疏采样关键帧,并将其余帧视为非关键帧;使用大而深的网络提取关键帧特征,使用微小网络提取非关键帧特征。为增强非关键帧特征,我们提出一种新颖的短期特征聚合方法,以快速方式将关键帧特征中的丰富信息传播至非关键帧特征。该快速特征聚合由压缩视频中自由可用的运动线索实现。此外,关键帧特征也基于光流进行聚合。传播得到的深度特征随后与直接提取的特征整合用于目标检测。特征提取与特征整合参数以端到端方式优化。所提出的视频目标检测网络在大规模ImageNet VID基准上评估,达到77.2% mAP,在使用Titan X GPU时以30 FPS速度取得与最先进精度相当的结果。源代码见\url{https://github.com/hustvl/LSFA}。

关键词

引用

@article{arxiv.2103.14529,
  title  = {Real-Time and Accurate Object Detection in Compressed Video by Long Short-term Feature Aggregation},
  author = {Xinggang Wang and Zhaojin Huang and Bencheng Liao and Lichao Huang and Yongchao Gong and Chang Huang},
  journal= {arXiv preprint arXiv:2103.14529},
  year   = {2021}
}