LongDWM:构建长期驾驶世界模型的跨粒度蒸馏
计算机视觉与模式识别
2025-06-03 v1
摘要
驾驶世界模型用于在当前状态和动作的条件下,通过视频生成来模拟未来。然而,当前模型在预测长期未来时往往存在严重的误差累积,这限制了其实际应用。近期研究利用 Diffusion Transformer (DiT) 作为驾驶世界模型的骨干网络,以提高学习的灵活性。然而,这些模型总是在短视频片段(高帧率且短时长)上进行训练,由于训练与推理之间的差距,多次展开生成难以产生连贯且合理的长视频。为此,我们提出了几种解决方案,以构建一个简单而有效的长期驾驶世界模型。首先,我们将世界模型学习分层解耦为大尺度运动学习和双向连续运动学习。然后,考虑到驾驶场景的连续性,我们提出了一种简单的蒸馏方法,其中细粒度视频流作为粗粒度流的自监督信号。该蒸馏旨在提高无限视频生成的连贯性。粗粒度与细粒度模块相互协调,以生成具有时间连贯性的长期视频。在公开基准 NuScenes 上,与最先进的前视图模型相比,我们的模型在生成 110 帧以上的视频任务中将 FVD 提升了 ,并将推理时间减少了 。更多视频(包括 90 秒时长)可在 https://Wang-Xiaodong1899.github.io/longdwm/ 获取。
引用
@article{arxiv.2506.01546,
title = {LongDWM: Cross-Granularity Distillation for Building a Long-Term Driving World Model},
author = {Xiaodong Wang and Zhirong Wu and Peixi Peng},
journal= {arXiv preprint arXiv:2506.01546},
year = {2025}
}
备注
project homepage: https://wang-xiaodong1899.github.io/longdwm/