NRSeg:基于驾驶世界模型的 BEV 语义分割噪声鲁棒学习
计算机视觉与模式识别
2026-02-25 v2 机器人学
图像与视频处理
摘要
鸟瞰图 (BEV) 语义分割是端到端自动驾驶系统中不可或缺的感知任务。无监督和半监督学习对于 BEV 任务至关重要,因为它们对于实际应用至关重要,但由于标记数据的均匀分布,表现不佳。本文我们探讨了利用来自驾驶世界模型的合成数据来增强标记数据多样性,以增强 BEV 分割的鲁棒性。然而,我们的初步发现表明,合成数据中的生成噪声损害了高效 BEV 模型学习。为了充分发挥合成数据来自世界模型的潜力,本文提出了 NRSeg,一个用于 BEV 语义分割的噪声鲁棒学习框架。具体而言,提出了视角几何一致性度量 (PGCM),用于定量评估生成数据对模型学习的指导能力。该度量源于生成数据视角道路掩码与从 BEV 标签投影的掩码之间的对齐程度。此外,设计了双分布平行预测 (BiDPP),以增强模型的固有鲁棒性,其中学习过程通过多inomial 和 Dirichlet 分布的平行预测来约束。前者有效预测语义概率,而后者采用证据深度学习来实现不确定性量化。进一步设计了层次局部语义排除 (HLSE) 模块,以解决 BEV 语义分割任务中固有的非互斥性。实验结果表明,NRSeg 实现了最先进的性能,在无监督和半监督 BEV 分割任务中分别实现了 mIoU 提升最高可达 13.8% 和 11.4%。源代码将公开于 https://github.com/lynn-yu/NRSeg。
引用
@article{arxiv.2507.04002,
title = {NRSeg: Noise-Resilient Learning for BEV Semantic Segmentation via Driving World Models},
author = {Siyu Li and Fei Teng and Yihong Cao and Kailun Yang and Zhiyong Li and Yaonan Wang},
journal= {arXiv preprint arXiv:2507.04002},
year = {2026}
}
备注
Accepted to IEEE Transactions on Image Processing (TIP). The source code will be made publicly available at https://github.com/lynn-yu/NRSeg