中文

DriveLaW:在潜在驾驶世界中统一规划与视频生成

计算机视觉与模式识别 2026-04-20 v3

摘要

世界模型对于自动驾驶至关重要,因为它们学习情景随时间演化,以应对现实世界的长尾挑战。然而,当前方法将世界模型局限于有限角色:它们在看似统一的架构中运行,仍将世界预测和运动规划保持解耦。为弥合这一差距,我们提出 DriveLaW,一种新颖的范式,统一视频生成与运动规划。通过直接将其视频生成器的潜在表示注入规划器,DriveLaW 确保高保真未来生成与可靠轨迹规划之间具有内在一致性。具体而言,DriveLaW 包含两个核心组件:DriveLaW-Video,我们强大的世界模型,通过具有表现力潜在表示生成高保真预测,以及 DriveLaW-Act,一种扩散规划器,从 DriveLaW-Video 的潜在表示生成一致可靠的轨迹,两个组件均通过三阶段渐进式训练策略进行优化。我们统一范式的强大之处通过两项最新 state-of-the-art 结果证明:DriveLaW 不仅在视频预测方面显著提升,FID 提高 33.3%,FVD 提高 1.8%,也在 NAVSIM 规划基准上取得新纪录。

关键词

引用

@article{arxiv.2512.23421,
  title  = {DriveLaW:Unifying Planning and Video Generation in a Latent Driving World},
  author = {Tianze Xia and Yongkang Li and Lijun Zhou and Jingfeng Yao and Kaixin Xiong and Haiyang Sun and Bing Wang and Kun Ma and Guang Chen and Hangjun Ye and Wenyu Liu and Xinggang Wang},
  journal= {arXiv preprint arXiv:2512.23421},
  year   = {2026}
}

备注

18 pages, 6 figures, CVPR 2026