Epona:用于自动驾驶的自回归扩散世界模型
计算机视觉与模式识别
2025-07-01 v1
摘要
扩散模型在视频生成中展现了卓越的视觉质量,使其成为自动驾驶世界建模的有力候选。然而,现有的基于视频扩散的世界模型在处理可变长度、长时域预测以及集成轨迹规划方面存在困难。这是因为传统的视频扩散模型依赖于固定长度帧序列的全局联合分布建模,而不是在每个时间步顺序构建局部化分布。在这项工作中,我们提出了Epona,一种自回归扩散世界模型,通过两个关键创新实现局部化时空分布建模:1)解耦的时空分解,将时间动力学建模与细粒度未来世界生成分离;2)模块化轨迹与视频预测,在端到端框架中将运动规划与视觉建模无缝集成。我们的架构支持高分辨率、长时域生成,同时引入了一种新颖的前向链训练策略来解决自回归循环中的误差累积问题。实验结果表明,与先前工作相比,我们的方法在FVD上提升了7.4%,预测时长延长了数分钟,达到了最先进的性能。学习到的世界模型还可作为实时运动规划器,在NAVSIM基准测试上优于强大的端到端规划器。代码将在\href{https://github.com/Kevin-thu/Epona/}{https://github.com/Kevin-thu/Epona/}公开。
引用
@article{arxiv.2506.24113,
title = {Epona: Autoregressive Diffusion World Model for Autonomous Driving},
author = {Kaiwen Zhang and Zhenyu Tang and Xiaotao Hu and Xingang Pan and Xiaoyang Guo and Yuan Liu and Jingwei Huang and Li Yuan and Qian Zhang and Xiao-Xiao Long and Xun Cao and Wei Yin},
journal= {arXiv preprint arXiv:2506.24113},
year = {2025}
}
备注
ICCV2025, Project Page: https://kevin-thu.github.io/Epona/