改进的潜在一致性模型训练技术
计算机视觉与模式识别
2025-03-26 v2 机器学习
摘要
一致性模型是一类新的生成模型,能够在单步或多步内生成高质量样本。近期,一致性模型展示了令人印象深刻的性能,在像素空间取得了与扩散模型相当的结果。然而,将一致性训练扩展到大规模数据集,特别是用于文本到图像和视频生成任务的成功,取决于其在潜在空间中的性能。在这项工作中,我们分析了像素空间和潜在空间之间的统计差异,发现潜在数据通常包含高度脉冲性的离群值,这显著降低了iCT在潜在空间中的性能。为了解决这个问题,我们用柯西损失替换了伪胡伯损失,有效减轻了离群值的影响。此外,我们在早期时间步引入了扩散损失,并采用最优传输(OT)耦合来进一步提升性能。最后,我们引入了自适应缩放-c调度器来管理稳健的训练过程,并在架构中采用非缩放层归一化(Non-scaling LayerNorm),以更好地捕捉特征的统计特性并减少离群值的影响。通过这些策略,我们成功训练了能够通过一到两步进行高质量采样的潜在一致性模型,显著缩小了潜在一致性模型与扩散模型之间的性能差距。代码已在此发布:https://github.com/quandao10/sLCT/
引用
@article{arxiv.2502.01441,
title = {Improved Training Technique for Latent Consistency Models},
author = {Quan Dao and Khanh Doan and Di Liu and Trung Le and Dimitris Metaxas},
journal= {arXiv preprint arXiv:2502.01441},
year = {2025}
}
备注
Accepted at ICLR 2025