中文

MMDrive: 通过多表示融合实现超越视觉的交互式场景理解

计算机视觉与模式识别 2025-12-17 v2 机器人学

摘要

视觉-语言模型通过多源信息融合实现对复杂交通场景的理解和推理,将其确立为自动驾驶的核心技术。然而,现有的视觉-语言模型受限于二维平面中的图像理解范式,这限制了它们感知三维空间信息和执行深度语义融合的能力,导致在复杂自动驾驶环境中的性能不佳。本研究提出了 MMDrive,一个多模态视觉-语言模型框架,将传统的图像理解扩展到广义的三维场景理解框架。MMDrive 融合了三种互补模态,包括占用图、激光雷达点云和文本场景描述。为此,它引入了两个新颖的组件用于自适应跨模态融合和关键信息提取。具体而言,文本导向多模态调制器根据问题中的语义线索动态加权各模态的贡献,引导上下文感知的特征整合。跨模态抽象器采用可学习的抽象标记来生成紧凑的跨模态摘要,突出关键区域和本质语义。在 DriveLM 和 NuScenes-QA 基准上的全面评估表明,MMDrive 在自动驾驶领域的视觉-语言模型上取得了显著性能提升,在 DriveLM 上 BLEU-4 分数为 54.56,METEOR 为 41.78,在 NuScenes-QA 上准确率为 62.7%。MMDrive 有效打破了传统的仅图像理解瓶颈,使复杂驾驶环境中的鲁棒多模态推理成为可能,为可解释的自动驾驶场景理解提供了新的基础。

关键词

引用

@article{arxiv.2512.13177,
  title  = {MMDrive: Interactive Scene Understanding Beyond Vision with Multi-representational Fusion},
  author = {Minghui Hou and Wei-Hsing Huang and Shaofeng Liang and Daizong Liu and Tai-Hao Wen and Gang Wang and Runwei Guan and Weiping Ding},
  journal= {arXiv preprint arXiv:2512.13177},
  year   = {2025}
}