中文

MaskGWM:基于视频掩码重建的通用驾驶世界模型

计算机视觉与模式识别 2025-02-18 v1

摘要

基于预测动作后环境变化的世界模型对于具有强大泛化能力的自动驾驶模型至关重要。当前主流的驾驶世界模型主要基于视频预测模型构建。虽然这些模型能够利用先进的扩散生成器产生高保真视频序列,但受限于预测时长和整体泛化能力。在本文中,我们通过将生成损失与 MAE 风格的特征级上下文学习相结合来解决此问题。具体而言,我们提出了三个关键设计:(1) 一个规模更大的扩散转换器 (DiT) 结构,训练时附加掩码构建任务;(2) 我们设计与扩散过程相关的掩码 token,以处理掩码重建与生成扩散过程之间的模糊关系;(3) 我们通过利用行状掩码实现 shifted self-attention 而非 MAE 中的掩码自注意力,将掩码构建任务扩展到时空域。随后,我们采用行状跨视图模块以匹配此掩码设计。基于上述改进,我们提出了 MaskGWM:以视频掩码重建为基础的通用驾驶世界模型。我们的模型包含两个变体:MaskGWM-long 侧重于长期预测,MaskGWM-mview 专注于多视图生成。在标准基准测试上的全面实验验证了所提出方法的有效性,包括 Nuscene 数据集的常规验证、OpenDV-2K 数据集的长期滚动预测以及 Waymo 数据集的零样本验证。这些数据集上的定量指标表明,我们的方法在提升当前最先进驾驶世界模型方面取得了显著成果。

关键词

引用

@article{arxiv.2502.11663,
  title  = {MaskGWM: A Generalizable Driving World Model with Video Mask Reconstruction},
  author = {Jingcheng Ni and Yuxin Guo and Yichen Liu and Rui Chen and Lewei Lu and Zehuan Wu},
  journal= {arXiv preprint arXiv:2502.11663},
  year   = {2025}
}