用于三维目标检测的多相机免标定BEV表征
计算机视觉与模式识别
2022-11-01 v1
摘要
在自动驾驶的先进范式中,从环视视图学习鸟瞰图(BEV)表征对于多任务框架至关重要。然而,现有基于深度估计或相机驱动注意力的方法在含噪声相机参数下难以稳定获得变换,主要面临两个挑战:准确的深度预测与标定。本工作中,我们提出一种完全多相机免标定 Transformer(CFT)以得到鲁棒 BEV 表征,其聚焦于隐式映射的探索,不依赖于相机内参与外参。为引导从图像视图到 BEV 的更好特征学习,CFT 通过我们设计的位置感知增强(PA)挖掘 BEV 中潜在的 3D 信息。不同于相机驱动的点级或全局变换,为在更有效区域内交互并降低计算开销,我们提出视图感知注意力,其同时减少冗余计算并加速收敛。CFT 在 nuScenes 检测任务排行榜上取得 49.7% 的 NDS,是首个去除相机参数的工作,性能可与其它几何引导方法相媲美。在无时序输入与其它模态信息下,CFT 以更小的图像输入 1600 * 640 取得第二高成绩。得益于视图注意力变体,CFT 将朴素注意力的显存与 transformer FLOPs 分别降低约 12% 与 60%,同时 NDS 提升 1.0%。此外,其对噪声相机参数的天然鲁棒性使 CFT 更具竞争力。
引用
@article{arxiv.2210.17252,
title = {Multi-Camera Calibration Free BEV Representation for 3D Object Detection},
author = {Hongxiang Jiang and Wenming Meng and Hongmei Zhu and Qian Zhang and Jihao Yin},
journal= {arXiv preprint arXiv:2210.17252},
year = {2022}
}
备注
15 pages, 7 figures