用于加速人类图像动画的一致性蒸馏技术
计算机视觉与模式识别
2025-04-16 v1
摘要
近期的人类图像动画研究受益于视频扩散模型,但其依赖大量迭代去噪步骤导致推理成本高昂且速度慢。一个直观的解决方案是采用一致性模型,通过一致性蒸馏实现有效的加速。然而,仅凭这一策略在人类图像动画中常导致质量下降,包括视觉模糊、运动退化和面部变形,尤其在动态区域表现突出。在本文中,我们提出了DanceLCM方法,并配合若干改进措施以提升视觉质量和运动连续性在低步数 regime 下的表现:(1) 分段一致性蒸馏,辅以轻量级头部融合真实视频潜在表示的监督,以缓解单一完整轨迹生成导致的累积误差;(2) 聚焦运动的损失函数,显式注入面部保真特征以提升面部真实性。大量定性和定量实验表明,DanceLCM 在仅需2-4步推理的情况下即可达到与最先进视频扩散模型相当的效果,显著降低推理负担而不损失视频质量。代码和模型将公开发布。
引用
@article{arxiv.2504.11143,
title = {Taming Consistency Distillation for Accelerated Human Image Animation},
author = {Xiang Wang and Shiwei Zhang and Hangjie Yuan and Yujie Wei and Yingya Zhang and Changxin Gao and Yuehuan Wang and Nong Sang},
journal= {arXiv preprint arXiv:2504.11143},
year = {2025}
}