DrivingWorld:通过 Video GPT 构建自动驾驶的世界模型
计算机视觉与模式识别
2024-12-31 v2
摘要
近期在自然语言处理中基于自回归(AR)生成模型(如 GPT 系列)的成功,激励了将此方法复制到视觉任务的尝试。一些工作试图将其扩展到自动驾驶领域,通过构建基于视频的世界模型来生成逼真的未来视频序列并预测 ego 状态。然而,先前的工作往往产生不令人满意的结果,因为经典的 GPT 框架设计用于处理 1 维语境信息(如文本),缺乏建模视频生成所必需的空间和时间动态的内在能力。本文提出了 DrivingWorld,这是一个面向自动驾驶的 GPT 风格世界模型,具备多种空间时间融合机制。这种设计有效地建模了空间和时间动态,促进了高保真、持久的视频生成。具体而言,我们提出了下一状态预测策略来建模连续帧之间的时间一致性,并应用下一标记预测策略来捕捉每帧内的空间信息。为进一步提升泛化能力,我们提出了一种新颖的掩码策略和标记预测权重策略,以缓解长期漂移问题并实现精确控制。我们的工作展示了能够生成持续超过 40 秒、且持续时间是当前领先自动驾驶世界模型的 2 倍以上的高保真且一致的视频剪辑。实验表明,与先前工作相比,我们的方法在视觉质量上取得优异成绩,并实现了显著更准确的可控未来视频生成。我们的代码可在 https://github.com/YvanYin/DrivingWorld 上获取。
引用
@article{arxiv.2412.19505,
title = {DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT},
author = {Xiaotao Hu and Wei Yin and Mingkai Jia and Junyuan Deng and Xiaoyang Guo and Qian Zhang and Xiaoxiao Long and Ping Tan},
journal= {arXiv preprint arXiv:2412.19505},
year = {2024}
}