基于度量路径的均匀离散扩散用于视频生成
计算机视觉与模式识别
2025-10-29 v1
摘要
连续空间视频生成取得了快速进展,而离散方法则滞后于由于误差积累和长期上下文不一致的问题。本文重新审视离散生成建模,提出 Uniform discRete diffuSion with metric pAth(URSA),一个简单而强大的框架,弥合了与连续方法之间的差距,以实现可扩展的视频生成。URSA 的核心在于将视频生成任务形式化为对离散时空标记的迭代全局细化。它集成了两个关键设计:线性化度量路径和分辨率依赖的时间步移位机制。这些设计使 URSA 能够高效地扩展到高分辨率图像合成和长时程视频生成,同时只需大大减少的推理步骤。此外,我们引入了一种异步时序微调策略,将多种任务统一于单个模型,包括插值和图像到视频生成。对挑战性的视频和图像生成基准进行大量实验表明,URSA 在持续 outperform 现有离散方法,并达到与最先进连续扩散方法相当的性能。代码和模型可在 https://github.com/baaivision/URSA 获取。
引用
@article{arxiv.2510.24717,
title = {Uniform Discrete Diffusion with Metric Path for Video Generation},
author = {Haoge Deng and Ting Pan and Fan Zhang and Yang Liu and Zhuoyan Luo and Yufeng Cui and Wenxuan Wang and Chunhua Shen and Shiguang Shan and Zhaoxiang Zhang and Xinlong Wang},
journal= {arXiv preprint arXiv:2510.24717},
year = {2025}
}
备注
19 pages, 10 figures