融合之前先观察:用于鲁棒 3D 检测的 2D 引导跨模态对齐
计算机视觉与模式识别
2026-03-20 v4 人工智能
摘要
将 LiDAR 和相机输入集成到统一的鸟瞰图(BEV)表示中,对于增强自动驾驶车辆的 3D 感知能力至关重要。然而,现有方法存在 LiDAR 与相机特征之间的空间错位问题,这会导致相机分支中的深度监督不准确,并在跨模态特征聚合期间产生错误的融合。这种错位的根本原因在于投影误差,这些误差源于标定不准确和卷帘快门效应。本工作的关键洞察是,这些投影误差的位置并非随机而是高度可预测的,因为它们集中在物体-背景边界处,2D 检测器可以可靠地识别这些边界。基于此,我们的主要动机是在融合前利用 2D 物体先验来预对齐跨模态特征。为了解决局部错位,我们提出了先验引导深度校准(PGDC),利用 2D 先验缓解错位并保留正确的跨模态特征对。为了解决全局错位,我们引入了感知不连续的几何融合(DAGF),以抑制来自 PGDC 的残余噪声,并显式增强物体-背景边界处的急剧深度过渡,从而产生具有结构感知的表示。为了有效利用这些对齐的表示,我们加入了结构引导深度调制器(SGDM),使用门控注意力机制高效融合对齐的深度和图像特征。我们的方法在 nuScenes 验证数据集上取得了 SOTA 性能,其 mAP 和 NDS 分别达到 71.5% 和 73.6%。此外,在 Argoverse 2 验证集上,我们取得了 41.7% 的竞争性 mAP。
关键词
引用
@article{arxiv.2507.16861,
title = {Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection},
author = {Xiang Li and Zhangchi Hu and Xiao Xu and Bin Kong},
journal= {arXiv preprint arXiv:2507.16861},
year = {2026}
}
备注
accepted to cvpr 2026