中文

通过尺度-时间格优化视频目标检测

计算机视觉与模式识别 2018-04-17 v1

摘要

高性能目标检测依赖昂贵的卷积网络来计算特征,这在实际应用中常常带来重大挑战,例如需要从视频流中实时检测目标的场景。该问题的关键在于以有效的方式用精度换取效率,即在保持有竞争力的性能的同时降低计算成本。为了寻求良好的平衡,以往的工作通常侧重于优化模型架构。本文探索了一种替代方法,即在尺度-时间空间上重新分配计算。基本思想是稀疏地执行昂贵的检测,并利用它们之间极强的相关性,通过成本显著更低的网络在尺度和时间上传播结果。具体而言,我们提出了一个在尺度-时间格上集成检测、时间传播和跨尺度细化的统一框架。在该框架上,可以探索各种策略以平衡性能和成本。利用这种灵活性,我们进一步开发了一种按需调用检测器的自适应方案,从而获得了改善的权衡。在 ImageNet VID 数据集上,所提方法可以在 20 fps 下实现 79.6% 的有竞争力的 mAP,或在 62 fps 下实现 79.0% 的 mAP 作为性能/速度权衡。

关键词

引用

@article{arxiv.1804.05472,
  title  = {Optimizing Video Object Detection via a Scale-Time Lattice},
  author = {Kai Chen and Jiaqi Wang and Shuo Yang and Xingcheng Zhang and Yuanjun Xiong and Chen Change Loy and Dahua Lin},
  journal= {arXiv preprint arXiv:1804.05472},
  year   = {2018}
}

备注

Accepted to CVPR 2018. Project page: http://mmlab.ie.cuhk.edu.hk/projects/ST-Lattice/