中文

基于链式训练-free 扩散模型专家的解耦视频生成

计算机视觉与模式识别 2024-12-30 v4

摘要

视频生成模型在电影制作等领域具有巨大的潜力。然而,当前视频扩散模型因视频生成任务的极端复杂性,需高计算成本且生成效果次优。本文提出一种高效视频生成框架 ConFiner,将视频生成解耦为更易处理的子任务:结构控制与空间时间细化。它可通过链式调用若干即插即用扩散模型专家实现,每个专家负责解耦后的子任务。细化过程中,我们引入协同去噪技术,能够将多个扩散模型专家的能力融合为单一采样。此外,我们设计了 ConFiner-Long 框架,通过对 ConFiner 的三种约束策略实现长时段视频生成。实验结果表明,ConFiner 仅需约 10% 的推理成本,即可在所有客观与主观指标上超越 Lavie 和 Modelscope 等代表模型。ConFiner-Long 能生成最长达 600 帧的高质量连贯视频。

关键词

引用

@article{arxiv.2408.13423,
  title  = {Decoupled Video Generation with Chain of Training-free Diffusion Model Experts},
  author = {Wenhao Li and Yichao Cao and Xiu Su and Xi Lin and Shan You and Mingkai Zheng and Yi Chen and Chang Xu},
  journal= {arXiv preprint arXiv:2408.13423},
  year   = {2024}
}