分析与改进扩散模型的训练动态
计算机视觉与模式识别
2024-03-21 v2 人工智能
机器学习
神经与进化计算
机器学习
摘要
扩散模型凭借其向大型数据集无可比拟的扩展能力,目前主导着数据驱动的图像合成领域。在本文中,我们识别并纠正了流行的 ADM 扩散模型架构中导致训练不均匀和低效的若干原因,而未改变其高层结构。观察到在训练过程中网络激活值和权重的幅度变化与失衡不受控制,我们重新设计了网络层,以在期望上保持激活、权重和更新的幅度。我们发现,系统性地应用这一理念消除了观察到的漂移和失衡,从而在同等计算复杂度下产生相当好的网络。我们的修改将 ImageNet-512 合成中先前记录的 FID 2.41 提升至 1.81,这是使用快速确定性采样实现的。作为一项独立贡献,我们提出了一种事后设定指数移动平均(EMA)参数的方法,即在完成训练运行之后进行。这允许在不进行多次训练运行的情况下精确调整 EMA 长度,并揭示了其与网络架构、训练时间和引导之间令人惊讶的相互作用。
引用
@article{arxiv.2312.02696,
title = {Analyzing and Improving the Training Dynamics of Diffusion Models},
author = {Tero Karras and Miika Aittala and Jaakko Lehtinen and Janne Hellsten and Timo Aila and Samuli Laine},
journal= {arXiv preprint arXiv:2312.02696},
year = {2024}
}