Lift-Attend-Splat:基于Transformer的鸟瞰图相机-激光雷达融合
计算机视觉与模式识别
2024-05-22 v3 机器学习
摘要
结合互补的传感器模态对于为自动驾驶等安全关键机器人应用提供鲁棒感知至关重要。最近用于AD的先进相机-激光雷达融合方法依赖于单目深度估计,而单目深度估计与直接使用激光雷达深度信息相比是一项众所周知的困难任务。在这里,我们发现这种方法没有按预期利用深度,并且表明简单地改进深度估计并不会导致目标检测性能的提升。引人注目的是,我们还发现完全去除深度估计并不会显著降低目标检测性能,这表明在相机-激光雷达融合过程中依赖单目深度可能是一个不必要的架构瓶颈。在这项工作中,我们引入了一种新颖的融合方法,完全绕过单目深度估计,而是使用简单的注意力机制在鸟瞰图网格中选择和融合相机和激光雷达特征。我们表明,我们的模型可以根据激光雷达特征的可用性来调节其相机特征的使用,并且在nuScenes数据集上比依赖单目深度估计的基线方法产生更好的3D目标检测。
引用
@article{arxiv.2312.14919,
title = {Lift-Attend-Splat: Bird's-eye-view camera-lidar fusion using transformers},
author = {James Gunn and Zygmunt Lenyk and Anuj Sharma and Andrea Donati and Alexandru Buburuzan and John Redford and Romain Mueller},
journal= {arXiv preprint arXiv:2312.14919},
year = {2024}
}
备注
Updated method figure; camera ready