中文

UniM$^2$AE:面向自动驾驶三维感知的具有统一三维表示的多模态掩码自编码器

计算机视觉与模式识别 2024-08-26 v3

摘要

掩码自编码器(MAE)在学习有力表示方面发挥着关键作用,在自动驾驶所需的各种三维感知任务中取得了优异结果。在真实驾驶场景中,通常部署多种传感器以实现全面环境感知。尽管融合这些传感器的多模态特征可产生丰富而强大的特征,但由于不同模态间存在显著差异,MAE方法在处理此种融合时面临明显挑战。本研究深入探讨面向自动驾驶统一表示空间的多模态掩码自编码器,旨在开创两种不同模态更高效的融合。为精细结合图像固有语义与LiDAR点云几何细节,我们提出UniM2^2AE。该模型是一个有力且简洁的多模态自监督预训练框架,主要包括两项设计。首先,它将两种模态的特征投影至统一的三维体素空间,以精细结合鸟瞰图(BEV)与高度维度。该扩展可精确表示物体并减少多模态特征对齐时的信息损失。其次,引入多模态三维交互模块(MMIM)以在交互过程中促进高效的模态间交互。在nuScenes数据集上的大量实验证实了UniM2^2AE的有效性,表明其使三维目标检测与BEV地图分割分别提升1.2% NDS与6.5% mIoU。代码见 https://github.com/hollow-503/UniM2AE。

关键词

引用

@article{arxiv.2308.10421,
  title  = {UniM$^2$AE: Multi-modal Masked Autoencoders with Unified 3D Representation for 3D Perception in Autonomous Driving},
  author = {Jian Zou and Tianyu Huang and Guanglei Yang and Zhenhua Guo and Tao Luo and Chun-Mei Feng and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2308.10421},
  year   = {2024}
}

备注

Code available at https://github.com/hollow-503/UniM2AE