中文

基于时空Transformers的端到端视频目标检测

计算机视觉与模式识别 2021-05-25 v1

摘要

近来,DETR与Deformable DETR被提出以消除目标检测中对许多手工设计组件的需求,同时展现出与先前复杂手工检测器相当的良好性能。然而,它们在视频目标检测(VOD)上的性能尚未得到充分探索。本文中,我们提出TransVOD,一种基于时空Transformer架构的端到端视频目标检测模型。本文旨在精简VOD流程,有效去除对许多用于特征聚合的手工设计组件的需求,例如光流、循环神经网络、关系网络。此外,得益于DETR中的目标查询设计,我们的方法不需要诸如Seq-NMS或Tubelet rescoring等复杂的后处理方法,从而保持流程简单清晰。特别地,我们提出时序Transformer以聚合每帧的空间目标查询与特征记忆。我们的时序Transformer由三部分组成:编码多帧空间细节的时序可变形Transformer编码器(TDTE)、融合目标查询的时序查询编码器(TQE),以及获取当前帧检测结果的时序可变形Transformer解码器。这些设计在ImageNet VID数据集上将强大的基线Deformable DETR显著提升了(3%–4% mAP)。TransVOD在ImageNet VID基准上取得了可比的性能。我们希望我们的TransVOD能为视频目标检测提供新视角。代码将在 https://github.com/SJTU-LuHe/TransVOD 公开。

关键词

引用

@article{arxiv.2105.10920,
  title  = {End-to-End Video Object Detection with Spatial-Temporal Transformers},
  author = {Lu He and Qianyu Zhou and Xiangtai Li and Li Niu and Guangliang Cheng and Xiao Li and Wenxuan Liu and Yunhai Tong and Lizhuang Ma and Liqing Zhang},
  journal= {arXiv preprint arXiv:2105.10920},
  year   = {2021}
}