中文

Paris 2.0:用于视频生成的去中心化扩散模型

计算机视觉与模式识别 2026-05-29 v3 机器学习

摘要

我们提出了 Paris 2.0,这是首个通过去中心化计算预训练的视频生成模型。其训练配方基于 Paris 1.0(arXiv:2510.03434),即首个开放权重的去中心化扩散模型(DDM),表明图像生成可以在没有单一 GPU 集群的情况下进行训练。然而,受去中心化训练限制的时序一致视频生成一直是未解决的问题,Paris 2.0 解决了这一问题。在低分辨率文本到视频训练中,与在相同数据上以匹配总计算预算进行的单一模型相比,Paris 2.0 将 FID 从 561.04 降至 279.01,约 2 倍的改进,同时提升了 CLIP 文本视频相似度和审美评分。

关键词

引用

@article{arxiv.2605.26064,
  title  = {Paris 2.0: A Decentralized Diffusion Model for Video Generation},
  author = {Ali Rouzbayani and Bidhan Roy and Marcos Villagra and Zhiying Jiang},
  journal= {arXiv preprint arXiv:2605.26064},
  year   = {2026}
}

备注

6 pages, 5 figures