TransVOD:基于时空 Transformer 的端到端视频目标检测
摘要
检测 Transformer(DETR)和可变形 DETR 已被提出,以消除目标检测中对许多手工设计组件的需求,同时展现出与先前复杂手工检测器相当的良好性能。然而,它们在视频目标检测(VOD)上的性能尚未得到充分探索。本文中,我们提出 TransVOD,这是首个基于时空 Transformer 架构的端到端视频目标检测系统。本文的首要目标是简化 VOD 流程,有效去除对许多用于特征聚合的手工设计组件(例如光流模型、关系网络)的需求。此外,受益于 DETR 中的目标查询设计,我们的方法不需要诸如 Seq-NMS 等复杂的后处理方法。具体而言,我们提出一种时序 Transformer 来聚合每帧的空间目标查询与特征记忆。我们的时序 Transformer 由两个组件构成:用于融合目标查询的时序查询编码器(TQE),以及用于获取当前帧检测结果的时序可变形 Transformer 解码器(TDTD)。这些设计在 ImageNet VID 数据集上将强大的可变形 DETR 基线显著提升了(3%–4% mAP)。随后,我们提出 TransVOD 的两个改进版本,包括 TransVOD++ 和 TransVOD Lite。前者通过动态卷积将目标级信息融合进目标查询,而后者将整个视频片段建模为输出以加快推理时间。我们在实验部分对所有三种模型给出了详细分析。特别地,我们提出的 TransVOD++ 在 ImageNet VID 上以 90.0% mAP 刷新了准确率的最优(SOTA)纪录。我们提出的 TransVOD Lite 也实现了最佳的速度与准确率权衡,在单块 V100 GPU 设备上以约 30 FPS 运行的同时达到 83.7% mAP。
引用
@article{arxiv.2201.05047,
title = {TransVOD: End-to-End Video Object Detection with Spatial-Temporal Transformers},
author = {Qianyu Zhou and Xiangtai Li and Lu He and Yibo Yang and Guangliang Cheng and Yunhai Tong and Lizhuang Ma and Dacheng Tao},
journal= {arXiv preprint arXiv:2201.05047},
year = {2022}
}
备注
Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (IEEE TPAMI), extended version of arXiv:2105.10920