AccVideo:使用合成数据集加速视频扩散模型
计算机视觉与模式识别
2025-03-26 v1
摘要
扩散模型在视频生成领域取得了显著进展。然而,其迭代去噪特性需要大量推理步骤来生成视频,这既慢又计算成本高。在本文中,我们首先详细分析了现有扩散蒸馏方法中存在的挑战,并提出了一种新颖的高效方法,即AccVideo,通过使用合成数据集减少推理步骤来加速视频扩散模型。我们利用预训练的视频扩散模型生成多个有效的去噪轨迹作为我们的合成数据集,从而在蒸馏过程中消除了无用数据点的使用。基于合成数据集,我们设计了一种基于轨迹的少步引导,利用去噪轨迹中的关键数据点来学习噪声到视频的映射,从而能够在更少的步骤中生成视频。此外,由于合成数据集捕获了每个扩散时间步的数据分布,我们引入了一种对抗训练策略,以使学生模型的输出分布与我们的合成数据集对齐,从而提高视频质量。大量实验表明,我们的模型在生成速度上比教师模型提高了8.5倍,同时保持了可比的性能。与之前的加速方法相比,我们的方法能够生成更高质量和分辨率的视频,即5秒、720x1280、24fps。
引用
@article{arxiv.2503.19462,
title = {AccVideo: Accelerating Video Diffusion Model with Synthetic Dataset},
author = {Haiyu Zhang and Xinyuan Chen and Yaohui Wang and Xihui Liu and Yunhong Wang and Yu Qiao},
journal= {arXiv preprint arXiv:2503.19462},
year = {2025}
}
备注
Project Page: https://aejion.github.io/accvideo/