FADA:基于混合监督多-CFG 蒸馏的快速扩散头像合成
计算机视觉与模式识别
2025-04-07 v2 人工智能
图形学
声音
音频与语音处理
摘要
基于扩散模型的音频驱动说话头像方法最近因其高保真、生动和富有表现力的效果而受到关注。然而,其慢速的推理速度限制了实际应用。尽管发展出各种针对扩散模型的蒸馏技术,但我们发现直接的扩散蒸馏方法并未获得令人满意的结果。蒸馏模型在开放集合输入图像上的鲁棒性较差,以及与教师模型相比,音频与视频之间的关联性下降,削弱了扩散模型的优势。为此,我们提出了FADA(Fast Diffusion Avatar Synthesis with Mixed-Supervised Multi-CFG Distillation)。我们首先设计了混合监督损失,以利用不同质量的数据并提升整体模型能力和鲁棒性。此外,我们提出了基于可学习标记的多-CFG 蒸馏,以利用音频与参考图像条件之间的关联性,减少多-CFG 导致的三次推理运行,同时接受可接受的质量下降。广泛的实验表明,FADA 在多个数据集上生成的视频与最新基于扩散模型的方法相当,同时实现了 4.17-12.5 倍的 NFE 加速。我们的演示页面已公开 http://fadavatar.github.io。
引用
@article{arxiv.2412.16915,
title = {FADA: Fast Diffusion Avatar Synthesis with Mixed-Supervised Multi-CFG Distillation},
author = {Tianyun Zhong and Chao Liang and Jianwen Jiang and Gaojie Lin and Jiaqi Yang and Zhou Zhao},
journal= {arXiv preprint arXiv:2412.16915},
year = {2025}
}
备注
CVPR 2025, Homepage https://fadavatar.github.io/