中文

CoWorld-VLA:用于自动驾驶的多专家世界模型思考

计算机视觉与模式识别 2026-05-14 v2 人工智能

摘要

视觉-语言-动作(VLA)模型已成为端到端自动驾驶的有前景的范例。然而,现有的推理机制仍难以提供面向规划的中间表征:文本链式思考(CoT)未能保留连续时空结构,潜在世界推理在直接用于动作生成时仍难以使用。本文提出了 CoWorld-VLA,一个用于自动驾驶的多专家世界推理框架,其中世界表征作为显式条件来指导动作规划。CoWorld-VLA 通过多源监督提取互补的世界信息,并将其编码为 VLA 中的专家标记,从而提供面向规划的条件信号。具体而言,我们构建了四种类型的标记:语义交互标记、几何结构标记、动态演化标记和自我轨迹标记,分别建模交互意图、空间结构、未来时间动态和行为目标。在动作生成期间,CoWorld-VLA 采用基于扩散的层次化多专家融合规划器,并在联合去噪过程中与场景上下文相耦合,以生成连续的自我轨迹。实验表明,CoWorld-VLA 在 NAVSIM v1 基准上的未来场景生成和规划方面均取得竞争成绩,显示出在碰撞避免和轨迹精度方面的强大性能。消融研究进一步验证了专家标记的互补性以及其作为动作生成规划条件的有效性。代码将在 https://github.com/AFARI-Research/CoWorld-VLA 提供。

关键词

引用

@article{arxiv.2605.10426,
  title  = {CoWorld-VLA: Thinking in a Multi-Expert World Model for Autonomous Driving},
  author = {Minqing Huang and Yujiao Xiang and Zihan Liang and Jiajie Huang and Jingqi Wang and Zhi Xu and Feiyang Tan and Hangning Zhou and Mu Yang and Gong Che},
  journal= {arXiv preprint arXiv:2605.10426},
  year   = {2026}
}