中文

面向 3D BEV 对象检测的语义引导的多模态遮蔽自编码器预训练

计算机视觉与模式识别 2026-05-26 v1

摘要

准确的 3D 鸟瞰图 (BEV) 对象检测是自动驾驶的关键任务,强烈依赖于来自摄像头和 LiDAR 等互补传感器的有效多模态表征。多模态遮蔽自编码器已显示出学习此类表征以支持下游 3D BEV 对象检测的强大潜力。然而,现有方法通常对相机和 LiDAR 输入施加均匀随机遮蔽,平等对待所有区域,仅通过遮蔽重建学习表征。我们提出一种语义引导的多模态遮蔽自编码器框架,通过两个独立组件引入语义信息:(i) 语义引导的 LiDAR 体素遮蔽,显著保留语义重要的 LiDAR 区域;(ii) 辅助的点级 LiDAR 语义解码器分支,除重建外还注入语义指导。在 BEVFusion 3D 对象检测上,我们的语义引导预训练策略相对于标准 UniM2AE 基线在 nuScenes mini 验证集上实现性能提升:语义引导的 LiDAR 体素遮蔽实现平均精度 (mAP) 提升 1.49% 和 nuScenes 检测得分 (NDS) 提升 1.66%,而解码器侧点语义监督相对于基线实现 mAP 提升 1.39% 和 NDS 提升 3.22%。

关键词

引用

@article{arxiv.2605.25262,
  title  = {Semantics-Guided Multimodal Masked Autoencoder Pretraining for 3D BEV Object Detection},
  author = {Prabuddhi Wariyapperuma and Rajitha de Silva and Marc Hanheide and Thomas Bohné and Leonardo Guevara},
  journal= {arXiv preprint arXiv:2605.25262},
  year   = {2026}
}

备注

Accepted at the ICRA 2026 Workshop on Semantics for Reliable Robot Autonomy (SRRA) as a lightning talk and poster