中文

面向自动驾驶的具备显式链式思维的视觉语言动作模型CoT4AD

计算机视觉与模式识别 2025-12-01 v1 人工智能

摘要

视觉语言动作(VLA)模型最近在 end-to-end 自动驾驶中受到广泛关注,因其强大的推理能力和丰富的世界知识。然而,现有的VLA模型往往受限于数值推理能力较差且输入输出映射过于简化,限制了其在需要逐步因果推理的复杂驾驶场景中的性能。为此,我们提出CoT4AD,一种为自动驾驶引入链式思维(Chain-of-Thought, CoT)推理的 novel VLA框架,以增强视觉语言模型(VLM)中的数值和因果推理能力。CoT4AD将视觉观察和语言指令整合,用于执行语义推理、场景理解和轨迹规划。在训练期间,它显式地模型 perception-question-prediction-action CoT,以跨多个驾驶任务对齐推理空间与动作空间。在推理期间,它执行隐式 CoT 推理,以在动态环境中实现一致的数值推理和稳健的决策。广泛的实验在真实世界和模拟基准测试中进行,包括 nuScenes 和 Bench2Drive,结果表明CoT4AD在 open-loop 和 closed-loop 评估中实现了最先进的性能。代码将在论文接受后发布。

关键词

引用

@article{arxiv.2511.22532,
  title  = {CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving},
  author = {Zhaohui Wang and Tengbo Yu and Hao Tang},
  journal= {arXiv preprint arXiv:2511.22532},
  year   = {2025}
}

备注

10 pages, 3 figures