中文

RESAR-BEV:面向 BEV 分割的可解释化学生进化方法,用于相机-雷达融合

计算机视觉与模式识别 2026-03-06 v2

摘要

鸟瞰视角 (BEV) 语义分割为自动驾驶提供全面的环境感知,但受多模态错位和传感器噪声的制约。我们提出 RESAR-BEV,一种渐进式细化框架,超越单步骤 end-to-end 方法:(1) 通过 residual autoregressive learning 实现渐进式细化,将 BEV 分割分解为可解释的粗到细阶段,通过我们的 Drive-Transformer 和 Modifier-Transformer 残差预测级联架构;(2) 结合地面近距离体素与自适应高度偏移和 dual-path voxel feature encoding (max+attention pooling) 实现稳健的 BEV 表示,以高效特征提取;(3) 采用离线 Ground Truth 分解和在线联合优化实现解耦监督,防止过拟合并确保结构一致性。在 nuScenes 上的实验表明,RESAR-BEV 在 7 个关键驾驶场景类别上实现了 54.0% mIoU,实现了 14.6 FPS 的实时性能。该框架在长程感知和恶劣天气条件下的挑战场景中表现出稳健性。

关键词

引用

@article{arxiv.2505.06515,
  title  = {RESAR-BEV: An Explainable Progressive Residual Autoregressive Approach for Camera-Radar Fusion in BEV Segmentation},
  author = {Zhiwen Zeng and Yunfei Yin and Zheng Yuan and Argho Dey and Xianjian Bao},
  journal= {arXiv preprint arXiv:2505.06515},
  year   = {2026}
}

备注

This work was submitted to IEEE Transactions on Intelligent Transportation Systems (T-ITS) on 09-May-2025; revised 5 October 2025 and 26 January 2026; accepted 1 March 2026