中文

SRCN3D:用于紧凑型卷积多视角三维目标检测与跟踪的 Sparse R-CNN 3D

计算机视觉与模式识别 2023-07-04 v3

摘要

运动目标的检测与跟踪是自动驾驶环境感知的重要组成部分。在多视角基于相机的三维检测器这一蓬勃发展的领域中,不同的基于 transformer 的流水线被设计用于从透视视图的二维特征图中学习三维空间中的查询,但占主导地位的稠密 BEV 查询机制计算效率低下。本文提出 Sparse R-CNN 3D (SRCN3D),一种新颖的两阶段全稀疏检测器,其结合了稀疏查询、带框级采样的稀疏注意力以及稀疏预测。SRCN3D 采用级联结构,对固定数量的查询框与隐查询特征进行双轨更新。我们新颖的稀疏特征采样模块仅利用由三维查询框投影计算得到的局部二维感兴趣区域 (RoI) 特征进行进一步的框细化,从而构建出全卷积且易于部署的流水线。对于多目标跟踪,运动特征、查询特征与 RoI 特征在多假设数据关联中被综合利用。在 nuScenes 数据集上的大量实验表明,SRCN3D 在三维目标检测与多目标跟踪任务中均取得了具有竞争力的性能,同时相比基于 transformer 的方法展现出更优的效率。代码与模型见 https://github.com/synsin0/SRCN3D。

关键词

引用

@article{arxiv.2206.14451,
  title  = {SRCN3D: Sparse R-CNN 3D for Compact Convolutional Multi-View 3D Object Detection and Tracking},
  author = {Yining Shi and Jingyan Shen and Yifan Sun and Yunlong Wang and Jiaxin Li and Shiqi Sun and Kun Jiang and Diange Yang},
  journal= {arXiv preprint arXiv:2206.14451},
  year   = {2023}
}

备注

Accepted to Vision-centric Autonomous Driving(VCAD) Workshop at CVPR2023, For more details refer to http://vcad.site/#/papers