HeightFormer:无需额外数据、用于鸟瞰图纯相机三维目标检测的显式高度建模
计算机视觉与模式识别
2024-07-17 v3
摘要
基于视觉的鸟瞰图(BEV)表示是自动驾驶中一种新兴的感知形式。核心挑战在于利用多相机特征构建 BEV 空间,这是一个一对多的病态问题。深入考察所有先前的 BEV 表示生成方法,我们发现其中大多数可分为两类:在图像视图中建模深度,或在 BEV 空间中建模高度(大多以隐式方式)。在本文中,我们提出在 BEV 空间中显式建模高度,其不需要像 LiDAR 这样的额外数据,并且与建模深度相比可适配任意相机装置与类型。理论上,我们给出了基于高度的方法与基于深度的方法之间等价性的证明。考虑到该等价性以及建模高度的一些优势,我们提出了 HeightFormer,它以自递归方式建模高度与不确定性。无需任何额外数据,所提 HeightFormer 即可准确估计 BEV 中的高度。基准结果表明,与那些纯相机方法相比,HeightFormer 的性能达到了 SOTA。
引用
@article{arxiv.2307.13510,
title = {HeightFormer: Explicit Height Modeling without Extra Data for Camera-only 3D Object Detection in Bird's Eye View},
author = {Yiming Wu and Ruixiang Li and Zequn Qin and Xinhai Zhao and Xi Li},
journal= {arXiv preprint arXiv:2307.13510},
year = {2024}
}