从多摄像头图像学习高分辨率向量表示用于3D目标检测
计算机视觉与模式识别
2024-07-23 v1 机器人学
摘要
鸟瞰视角(BEV)表示是直接影响3D目标检测性能的关键因素,但传统的BEV网格表示会随着空间分辨率的增大导致二次计算成本。为解决这一局限性,本文提出一种新的基于摄像头的3D目标检测器,采用高分辨率向量表示:VectorFormer。我们提出的高分辨率向量表示与低分辨率BEV表示相结合,通过两个新颖模块(向量散射与聚集)高效地利用多摄像头图像在高分辨率下的3D几何信息。最终,所学习的带有更丰富场景上下文的向量表示可作为解码查询,用于最终预测。我们在nuScenes数据集上进行大量实验,展示出在NDS和推理时间方面的状态提升性能。此外,我们还探讨了结合我们所提出向量表示的基于查询- BEV方法,观察到一致的性能提升。
关键词
引用
@article{arxiv.2407.15354,
title = {Learning High-resolution Vector Representation from Multi-Camera Images for 3D Object Detection},
author = {Zhili Chen and Shuangjie Xu and Maosheng Ye and Zian Qian and Xiaoyi Zou and Dit-Yan Yeung and Qifeng Chen},
journal= {arXiv preprint arXiv:2407.15354},
year = {2024}
}
备注
Accepted to ECCV 2024. Project page: https://github.com/zlichen/VectorFormer