中文

不止于眼见?探讨训练中视觉语言驾驶模型的推理-规划断裂现象

人工智能 2025-10-07 v1 计算与语言 机器人学

摘要

视觉语言模型(VLM)驾驶代理通过首先生成自然语言推理,然后预测轨迹规划,承诺实现可解释的端到端自主驾驶。然而,是否满足于此推理驱动规划,这一关键但未被验证的假设值得探讨。为此,我们构建了 DriveMind,一个来自 nuPlan 的大规模驾驶视觉问答(VQA)语料库,包含计划对齐的链式思维(Chain-of-Thought, CoT)。我们的数据生成过程将传感器数据和标注转换为结构化输入,关键在于将先验信息与待推理信号分离,从而实现干净的信息消除。使用 DriveMind,我们训练了基于监督微调(SFT)和群体相对策略优化(GRPO)的代表性 VLM 代理,并使用 nuPlan 的指标进行评估。我们的结果不幸地表明,推理-规划之间存在持续的因果断裂:移除 ego/导航先验会导致规划得分大幅下降,而移除 CoT 仅产生轻微变化。注意力分析进一步显示,规划主要关注先验信息而非 CoT。基于此证据,我们提出了推理-规划解耦假设,即训练产生的推理是一种附带副产品,而非因果中介。为实现高效诊断,我们还引入了一种新型无训练探针,通过评估代理在面对轻微输入扰动时的规划鲁棒性来衡量其对先验信息的依赖。总之,我们为社区提供了一个新数据集和诊断工具,以评估未来模型的因果忠实度。

关键词

引用

@article{arxiv.2510.04532,
  title  = {More Than Meets the Eye? Uncovering the Reasoning-Planning Disconnect in Training Vision-Language Driving Models},
  author = {Xurui Song and Shuo Huai and JingJing Jiang and Jiayi Kong and Jun Luo},
  journal= {arXiv preprint arXiv:2510.04532},
  year   = {2025}
}

备注

The dataset will be released publicly once the paper is accepted for publication