基于链式训练-free 扩散模型专家的解耦视频生成
计算机视觉与模式识别
2024-12-30 v4
摘要
视频生成模型在电影制作等领域具有巨大的潜力。然而,当前视频扩散模型因视频生成任务的极端复杂性,需高计算成本且生成效果次优。本文提出一种高效视频生成框架 ConFiner,将视频生成解耦为更易处理的子任务:结构控制与空间时间细化。它可通过链式调用若干即插即用扩散模型专家实现,每个专家负责解耦后的子任务。细化过程中,我们引入协同去噪技术,能够将多个扩散模型专家的能力融合为单一采样。此外,我们设计了 ConFiner-Long 框架,通过对 ConFiner 的三种约束策略实现长时段视频生成。实验结果表明,ConFiner 仅需约 10% 的推理成本,即可在所有客观与主观指标上超越 Lavie 和 Modelscope 等代表模型。ConFiner-Long 能生成最长达 600 帧的高质量连贯视频。
关键词
引用
@article{arxiv.2408.13423,
title = {Decoupled Video Generation with Chain of Training-free Diffusion Model Experts},
author = {Wenhao Li and Yichao Cao and Xiu Su and Xi Lin and Shan You and Mingkai Zheng and Yi Chen and Chang Xu},
journal= {arXiv preprint arXiv:2408.13423},
year = {2024}
}