从一到多:用于 LiDAR 与相机融合的动态交叉注意力网络
计算机视觉与模式识别
2022-09-27 v1
摘要
LiDAR 与相机是自动驾驶中 3D 感知的两个互补传感器。LiDAR 点云具有精确的空间与几何信息,而 RGB 图像提供用于上下文推理的纹理与颜色数据。为联合利用 LiDAR 与相机,现有融合方法倾向于基于标定将每个 3D 点仅对齐到一个投影图像像素,即一对一映射。然而,这些方法的性能高度依赖标定质量,而标定对传感器的时间与空间同步十分敏感。因此,我们提出了一种动态交叉注意力(DCA)模块,其具有新颖的一对多跨模态映射,从初始投影向邻域学习多个偏移,从而对标定误差产生容忍度。此外,提出了一种动态查询增强来感知与模型无关的标定,进一步增强了 DCA 对初始未对齐的容忍度。命名为动态交叉注意力网络(DCAN)的整体融合架构利用了多级图像特征并适应点云的多种表示,使得 DCA 可作为插件式融合模块。在 nuScenes 和 KITTI 上的大量实验证明了 DCA 的有效性。所提 DCAN 在 nuScenes 检测挑战赛上优于最先进的方法。
引用
@article{arxiv.2209.12254,
title = {From One to Many: Dynamic Cross Attention Networks for LiDAR and Camera Fusion},
author = {Rui Wan and Shuangjie Xu and Wei Wu and Xiaoyi Zou and Tongyi Cao},
journal= {arXiv preprint arXiv:2209.12254},
year = {2022}
}