中文

DriveWorld-VLA:面向自动驾驶的统一潜在空间世界建模框架结合视觉语言动作

计算机视觉与模式识别 2026-02-09 v1 机器人学

摘要

端到端(E2E)自动驾驶近期因统一视觉语言动作(Vision-Language-Action, VLA)与世界模型以提升决策与前瞻想象而受到广泛关注。然而,现有方法由于未能有效在单一架构中统一未来场景演化与动作规划,且未能充分共享潜在状态,限制了视觉想象对动作决策的影响。为此,我们提出DriveWorld-VLA,一种新型框架,通过在表示层面紧密集成VLA与世界模型,实现潜在空间内的世界建模与规划,使VLA规划器能直接从整体场景演化建模中获益,减少对密集标注监督的依赖。此外,DriveWorld-VLA将世界模型的潜在状态作为VLA规划器的核心决策状态,促进规划器评估候选动作对未来场景演化的影响。通过在潜在空间中完全进行世界建模,DriveWorld-VLA支持在特征层面进行可控的、动作条件化的想象,避免了昂贵的像素级滚动。广泛的开放式闭环评估表明,DriveWorld-VLA的有效性:在NAVSIMv1上达到91.3 PDMS,在NAVSIMv2上达到86.8 EPDMS,在nuScenes上实现0.16的3秒平均碰撞率。代码和模型将发布于https://github.com/liulin815/DriveWorld-VLA.git。

关键词

引用

@article{arxiv.2602.06521,
  title  = {DriveWorld-VLA: Unified Latent-Space World Modeling with Vision-Language-Action for Autonomous Driving},
  author = {Feiyang jia and Lin Liu and Ziying Song and Caiyan Jia and Hangjun Ye and Xiaoshuai Hao and Long Chen},
  journal= {arXiv preprint arXiv:2602.06521},
  year   = {2026}
}

备注

20 pages, 7 tables, 12 figures