中文

从多摄像头图像学习高分辨率向量表示用于3D目标检测

计算机视觉与模式识别 2024-07-23 v1 机器人学

摘要

鸟瞰视角(BEV)表示是直接影响3D目标检测性能的关键因素,但传统的BEV网格表示会随着空间分辨率的增大导致二次计算成本。为解决这一局限性,本文提出一种新的基于摄像头的3D目标检测器,采用高分辨率向量表示:VectorFormer。我们提出的高分辨率向量表示与低分辨率BEV表示相结合,通过两个新颖模块(向量散射与聚集)高效地利用多摄像头图像在高分辨率下的3D几何信息。最终,所学习的带有更丰富场景上下文的向量表示可作为解码查询,用于最终预测。我们在nuScenes数据集上进行大量实验,展示出在NDS和推理时间方面的状态提升性能。此外,我们还探讨了结合我们所提出向量表示的基于查询- BEV方法,观察到一致的性能提升。

关键词

引用

@article{arxiv.2407.15354,
  title  = {Learning High-resolution Vector Representation from Multi-Camera Images for 3D Object Detection},
  author = {Zhili Chen and Shuangjie Xu and Maosheng Ye and Zian Qian and Xiaoyi Zou and Dit-Yan Yeung and Qifeng Chen},
  journal= {arXiv preprint arXiv:2407.15354},
  year   = {2024}
}

备注

Accepted to ECCV 2024. Project page: https://github.com/zlichen/VectorFormer