稳定一致性调优:理解与改进一致性模型
机器学习
2024-12-05 v3 计算机视觉与模式识别
摘要
扩散模型实现了卓越的生成质量,但由于去噪的迭代性质,生成速度较慢。相比之下,一致性模型作为一种新的生成模型家族,以显著更快的采样速度实现了具有竞争力的性能。这些模型要么通过一致性蒸馏(利用预训练的扩散模型)进行训练,要么直接从原始数据进行一致性训练/调优。在这项工作中,我们提出了一个用于理解一致性模型的新框架,将扩散模型的去噪过程建模为马尔可夫决策过程(MDP),并将一致性模型训练视为通过时序差分(TD)学习的值估计。更重要的是,这个框架使我们能够分析当前一致性训练/调优策略的局限性。基于简易一致性调优(ECT),我们提出了稳定一致性调优(SCT),它结合了使用分数恒等式的方差缩减学习。SCT在CIFAR-10和ImageNet-64等基准测试上带来了显著的性能提升。在ImageNet-64上,SCT实现了1步FID 2.42和2步FID 1.55,这是一致性模型的新SOTA。
引用
@article{arxiv.2410.18958,
title = {Stable Consistency Tuning: Understanding and Improving Consistency Models},
author = {Fu-Yun Wang and Zhengyang Geng and Hongsheng Li},
journal= {arXiv preprint arXiv:2410.18958},
year = {2024}
}
备注
Code is available at https://github.com/G-U-N/Stable-Consistency-Tuning