UP-Fuse: 基于不确定性引导的 LiDAR-相机融合用于 3D 全景分割
计算机视觉与模式识别
2026-02-24 v1 人工智能
摘要
LiDAR-相机融合通过利用相机图像补充稀疏 LiDAR 扫描,提高了 3D 全景分割,但也引入了一个关键失效模式。在不利条件下,相机传感器的性能下降或失效会显著损害感知系统的可靠性。为此,我们提出 UP-Fuse,一个在 2D 范围视图中实现不确定性感知融合的框架,能够在相机传感器退化、标定漂移和传感器失效的情况下保持稳健性。首先将原始 LiDAR 数据投影到范围视图并由 LiDAR 编码器编码,同时提取相机特征并投影到相同的共享空间。其核心,UP-Fuse 采用不确定性引导的融合模块,通过预测的不确定性图动态调制跨模态交互。这些图通过量化在各种视觉退化下的表征偏差来学习,确保只有可靠的视觉线索影响融合表示。融合后的范围视图特征由一种新型的混合 2D-3D transformer 解码,该 transformer 缓解了 2D 投影固有的空间歧义,并直接预测 3D 全景分割掩码。在 Panoptic nuScenes、SemanticKITTI 以及我们引入的 Panoptic Waymo 数据集上进行大规模实验,证明了 UP-Fuse 的有效性和稳健性,即使在严重的视觉损坏或错位情况下也能保持强性能,使其适用于安全关键场景的机器人感知。
引用
@article{arxiv.2602.19349,
title = {UP-Fuse: Uncertainty-guided LiDAR-Camera Fusion for 3D Panoptic Segmentation},
author = {Rohit Mohan and Florian Drews and Yakov Miron and Daniele Cattaneo and Abhinav Valada},
journal= {arXiv preprint arXiv:2602.19349},
year = {2026}
}