中文

DriveWAM:视频生成先验用于自主驾驶的可扩展世界-动作建模

计算机视觉与模式识别 2026-05-28 v1

摘要

预训练基础模型已成为端到端自主驾驶的重要基础。与主要在静态图像-文本对上预训练的视觉-语言模型不同,视频生成模型捕获了时序动力学和运动先验,天然适用于驾驶场景。我们提出 DriveWAM,一种将预训练视频扩散变换适配为自回归视频-动作策略的驾驶世界-动作模型。DriveWAM 将视频与动作流组织为统一的时序 token 序列,并在联合 flow-matching 目标下进行训练,既保留预训练视频生成架构,又将其大规模视频先验适配到动作生成。为融合高层次场景理解,我们引入场景演化驾驶指导,其中冻结的 VLM 为每个块生成特定的语义意图,以指导视频-动作生成。为保持长期展播的可控性,我们进一步引入选择性 KV 记忆,通过在推理时采用相关-冗余缓存选择机制,维持受限的、模态感知的视频和动作记忆池。在 NAVSIM 与 PhysicalAI-Autonomous-Vehicles 基准测试中,DriveWAM 实现了强大的规划性能,数据规模从 4k 扩展至 100k 驾驶片段的实验进一步确认了世界-动作建模对于端到端自主驾驶的规模潜力。

关键词

引用

@article{arxiv.2605.28544,
  title  = {DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving},
  author = {Chen Shi and Jinrui Xu and Shaoshuai Shi and Kehua Sheng and Bo Zhang and Li Jiang},
  journal= {arXiv preprint arXiv:2605.28544},
  year   = {2026}
}