DynVLA:用于自主驾驶中动作推理的世界动态学习
计算机视觉与模式识别
2026-03-16 v2 机器人学
摘要
我们提出了 DynVLA,一种引入新型 CoT 范式(称为 Dynamics CoT)的驾驶 VLA 模型。DynVLA 在动作生成之前预测紧凑的世界动态,从而实现更加明智和物理上 grounded 的决策。为了获得紧凑的动态表示,DynVLA 引入了 Dynamics Tokenizer 将未来演化压缩为少量动态 token。考虑到交互密集型驾驶场景中丰富的环境动态,DynVLA 解耦 ego-centric 和 environment-centric 动态,实现更精确的世界动态建模。我们随后通过 SFT 和 RFT 训练 DynVLA 在动作之前生成动态 token,提高决策质量同时保持低延迟推理。与缺乏细粒度时空理解的 Textual CoT 以及因密集图像预测产生显着冗余的 Visual CoT 相比,Dynamics CoT 以紧凑、可解释且高效的方式捕捉世界演化。在 NAVSIM、Bench2Drive 和大型内部数据集上的大量实验表明,DynVLA 持续优于 Textual CoT 和 Visual CoT 方法,验证了 Dynamics CoT 的有效性和实际价值。项目页面:https://yaoyao-jpg.github.io/dynvla。
关键词
引用
@article{arxiv.2603.11041,
title = {DynVLA: Learning World Dynamics for Action Reasoning in Autonomous Driving},
author = {Shuyao Shang and Bing Zhan and Yunfei Yan and Yuqi Wang and Yingyan Li and Yasong An and Xiaoman Wang and Jierui Liu and Lu Hou and Lue Fan and Zhaoxiang Zhang and Tieniu Tan},
journal= {arXiv preprint arXiv:2603.11041},
year = {2026}
}
备注
18 pages, 10 figures. Project Page: https://yaoyao-jpg.github.io/dynvla