Paris 2.0:用于视频生成的去中心化扩散模型
计算机视觉与模式识别
2026-05-29 v3 机器学习
摘要
我们提出了 Paris 2.0,这是首个通过去中心化计算预训练的视频生成模型。其训练配方基于 Paris 1.0(arXiv:2510.03434),即首个开放权重的去中心化扩散模型(DDM),表明图像生成可以在没有单一 GPU 集群的情况下进行训练。然而,受去中心化训练限制的时序一致视频生成一直是未解决的问题,Paris 2.0 解决了这一问题。在低分辨率文本到视频训练中,与在相同数据上以匹配总计算预算进行的单一模型相比,Paris 2.0 将 FID 从 561.04 降至 279.01,约 2 倍的改进,同时提升了 CLIP 文本视频相似度和审美评分。
引用
@article{arxiv.2605.26064,
title = {Paris 2.0: A Decentralized Diffusion Model for Video Generation},
author = {Ali Rouzbayani and Bidhan Roy and Marcos Villagra and Zhiying Jiang},
journal= {arXiv preprint arXiv:2605.26064},
year = {2026}
}
备注
6 pages, 5 figures