用于高效高质量视频生成的双专家一致性模型
计算机视觉与模式识别
2025-08-07 v2
摘要
扩散模型在视频合成方面取得了显著成果,但需要迭代去噪步骤,导致巨大的计算开销。一致性模型在加速扩散模型方面取得了重大进展。然而,将其直接应用于视频扩散模型通常会导致时间一致性和外观细节的严重退化。在本文中,通过分析一致性模型的训练动态,我们识别出蒸馏过程中存在的一种关键冲突学习动态:在不同时间步之间,优化梯度和损失贡献存在显著差异。这种差异阻碍了蒸馏后的学生模型达到最优状态,导致时间一致性受损和外观细节退化。为解决这一问题,我们提出了一种参数高效的 \textbf{双专家一致性模型~(DCM)},其中语义专家专注于学习语义布局和运动,而细节专家专门负责精细细节的优化。此外,我们引入时间相干性损失以改善语义专家的运动一致性,并应用 GAN 和特征匹配损失以增强细节专家的合成质量。我们的方法以显著减少的采样步数实现了最先进的视觉质量,证明了专家特化在视频扩散模型蒸馏中的有效性。我们的代码和模型可在 \href{https://github.com/Vchitect/DCM}{https://github.com/Vchitect/DCM} 获取。
引用
@article{arxiv.2506.03123,
title = {Dual-Expert Consistency Model for Efficient and High-Quality Video Generation},
author = {Zhengyao Lv and Chenyang Si and Tianlin Pan and Zhaoxi Chen and Kwan-Yee K. Wong and Yu Qiao and Ziwei Liu},
journal= {arXiv preprint arXiv:2506.03123},
year = {2025}
}
备注
This paper has been accepted to ICCV 2025