面向自动驾驶的统一多模态表示学习
计算机视觉与模式识别
2026-03-10 v1 机器学习
摘要
对比语言-图像预训练 (CLIP) 在对齐视觉与文本表示方面展现了惊人的性能,最近的研究将这一范式扩展到 3D 视觉以提高自动驾驶场景理解。在实际应用中,常用单两模态对之间的余弦相似度来指导 3D 编码器的训练。然而,仅考虑单个模态对之间的相似度而非所有模态联合,无法确保整个多模态空间中的一致且统一的对齐。在本文中,我们提出对比张量预训练 (CTP) 框架,同时在统一嵌入空间中对多个模态进行对齐,以增强端到端自动驾驶。与单两模态余弦相似度对齐相比,我们的方法将 2D 相似矩阵扩展为多模态相似张量。此外,我们引入张量损失以实现跨所有模态的联合对比学习。为验证框架的有效性,我们构建了一个源自现有自动驾驶数据集的文本-图像-点云三元组数据集。结果表明,所提统一多模态对齐框架在两种场景中均取得优异性能:(i) 将 3D 编码器与预训练 CLIP 编码器对齐,以及 (ii) 从头开始预训练所有编码器。
引用
@article{arxiv.2603.07874,
title = {Toward Unified Multimodal Representation Learning for Autonomous Driving},
author = {Ximeng Tao and Dimitar Filev and Gaurav Pandey},
journal= {arXiv preprint arXiv:2603.07874},
year = {2026}
}