中文

MindDrive: 一个连接世界模型与视觉语言模型的端到端自动驾驶全栈框架

计算机视觉与模式识别 2025-12-09 v2

摘要

端到端自动驾驶(E2E-AD)已成为一种新范式,其中轨迹规划发挥着关键作用。现有研究主要遵循两个方向:面向轨迹生成,侧重于通过简单的决策机制生成高质量轨迹;以及面向轨迹选择,通过多维评估选取最优轨迹,但缺乏充分的生成能力。在本工作中,我们提出 MindDrive,一个将高质量轨迹生成与综合决策推理相统一的协调框架。它建立了一种结构化的推理范式——"上下文模拟—候选生成—多目标权衡"。具体而言,所提出的未来感知轨迹生成器(FaTG)基于世界动作模型(WaM),执行以自车为条件的"假设"模拟,以预测潜在未来场景并生成前瞻性轨迹候选。在此基础上,面向视觉语言模型的评估器(VLoE)利用大型视觉语言模型的推理能力,在安全性、舒适性和效率维度上进行多目标评估,从而实现理性且以人为中心的决策制定。在 NAVSIM-v1 和 NAVSIM-v2 基准上的广泛实验表明,MindDrive 在多维驾驶指标上达到了最先进的性能,显著提升了安全性、合规性和泛化能力。本工作为可解释和认知引导的自动驾驶提供了一条有前景的路径。

关键词

引用

@article{arxiv.2512.04441,
  title  = {MindDrive: An All-in-One Framework Bridging World Models and Vision-Language Model for End-to-End Autonomous Driving},
  author = {Bin Sun and Yaoguang Cao and Yan Wang and Rui Wang and Jiachen Shang and Xiejie Feng and Jiayi Lu and Jia Shi and Shichun Yang and Xiaoyu Yan and Ziying Song},
  journal= {arXiv preprint arXiv:2512.04441},
  year   = {2025}
}