中文

用于端到端视频目标检测的时空可学习提议

计算机视觉与模式识别 2022-10-10 v2

摘要

本文提出利用时序信息生成目标提议用于视频目标检测的新思路。现代基于区域的视频目标检测器中的特征聚合严重依赖于从单帧RPN生成的所学提议。这必然引入了如NMS等额外组件,并在低质量帧上产生不可靠的提议。为应对这些限制,我们提出SparseVOD,一种采用Sparse R-CNN利用时序信息的新型视频目标检测流程。具体而言,我们在Sparse R-CNN的动态头中引入两个模块。首先,添加基于时序RoI Align操作的时序特征提取模块以提取RoI提议特征。其次,受序列级语义聚合启发,我们加入注意力引导的语义提议特征聚合模块以增强检测前的目标特征表示。所提SparseVOD有效缓解了复杂后处理方法的开销,并使整体流程可端到端训练。大量实验表明,我们的方法在mAP上比单帧Sparse RCNN显著提升8%-9%。此外,除了以ResNet-50为骨干在ImageNet VID数据集上取得80.3% mAP的state-of-the-art成绩外,我们的SparseVOD在提高IoU阈值(IoU > 0.5)时以显著优势超越现有基于提议的方法。

关键词

引用

@article{arxiv.2210.02368,
  title  = {Spatio-Temporal Learnable Proposals for End-to-End Video Object Detection},
  author = {Khurram Azeem Hashmi and Didier Stricker and Muhammamd Zeshan Afzal},
  journal= {arXiv preprint arXiv:2210.02368},
  year   = {2022}
}

备注

BMVC 2022