跳跃调优在扩散采样中令人惊讶的有效性
机器学习
2024-02-26 v1 人工智能
摘要
随着UNet架构的引入,扩散概率模型已成为图像生成任务中的主导力量。UNet的一个关键设计是编码器和解码器块之间的跳跃连接。尽管跳跃连接已被证明能提高训练稳定性和模型性能,但我们揭示出这种捷径可能成为变换复杂性的限制因素。随着采样步数的减少,生成过程以及UNet的角色越来越接近从高斯分布到目标的推前变换,这对网络的复杂性构成了挑战。为应对这一挑战,我们提出了Skip-Tuning,一种简单但令人惊讶地有效的免训练调优方法,作用于跳跃连接上。我们的方法在ImageNet 64上仅用19次NFE(1.75)即可使预训练EDM的FID提升100%,打破了ODE采样器无论采样步数多少的限制。令人惊讶的是,当我们增加采样步数时,这种改进仍然持续,甚至仅用39次NFE(1.57)就能超越EDM-2的最佳结果(1.58)。我们进行了全面的探索性实验以阐明这种令人惊讶的有效性。我们观察到,虽然Skip-Tuning增加了像素空间中的分数匹配损失,但特征空间中的损失却减少了,特别是在中间噪声水平,这与图像质量改进的最有效范围相吻合。
引用
@article{arxiv.2402.15170,
title = {The Surprising Effectiveness of Skip-Tuning in Diffusion Sampling},
author = {Jiajun Ma and Shuchen Xue and Tianyang Hu and Wenjia Wang and Zhaoqiang Liu and Zhenguo Li and Zhi-Ming Ma and Kenji Kawaguchi},
journal= {arXiv preprint arXiv:2402.15170},
year = {2024}
}