基于潜在链式思维的端到端驾驶世界建模
计算机视觉与模式识别
2026-04-15 v2 机器人学
摘要
近期的视觉语言动作 (VLA) 模型用于自动驾驶探索推理时长期推理作为提升驾驶性能和安全性于挑战场景的方法。大多数先前工作使用自然语言表达链式思维 (CoT) 推理,然后生成驾驶动作。然而,文本可能并非最有效的推理表示。在本工作中,我们提出了 Latent-CoT-Drive (LCDrive):一种在捕获所考虑驾驶动作可能结果的潜在语言中表达 CoT 的模型。我们的方案通过在与动作对齐的潜在空间中表示两者来统一 CoT 推理和决策。除了自然语言,该模型通过交替进行 (1) 动作提议标记,这些标记使用模型输出动作的相同词汇;和 (2) 世界模型标记,这些标记基于所学习的潜在世界模型并表达这些动作的未来结果。我们通过监督模型的动作提议和世界模型标记来 cold start 潜在 CoT,这些监督基于场景真实未来 rollout。随后我们使用闭环强化学习进行 post-training 以强化推理能力。在大型端到端驾驶基准测试中,LCDrive 实现了更快的推理速度、更好的轨迹质量以及来自交互式强化学习的更大改进,相较于非推理和文本推理基线。
引用
@article{arxiv.2512.10226,
title = {Latent Chain-of-Thought World Modeling for End-to-End Driving},
author = {Shuhan Tan and Kashyap Chitta and Yuxiao Chen and Ran Tian and Yurong You and Yan Wang and Wenjie Luo and Yulong Cao and Philipp Krahenbuhl and Marco Pavone and Boris Ivanovic},
journal= {arXiv preprint arXiv:2512.10226},
year = {2026}
}
备注
Accepted to CVPR 2026