快捷模型训练技巧的改进
计算机视觉与模式识别
2025-10-27 v1
摘要
快捷模型代表了一种有前景的、非对抗性的生成模型范式,独特地支持从单个训练好的网络进行一步、少步和多步采样。然而,由于其面临关键性能瓶颈,快捷模型的广泛采用一直受到阻碍。本文针对挼回快捷模型的五个核心问题进行了工作:(1)隐藏的复合引导缺陷,我们首次形式化了该缺陷,导致严重的图像伪影;(2)僵化的固定引导限制了推理时的控制灵活性;(3)由直接域中基于低级距离的依赖导致的频率偏置,使重构倾向于低频;(4)与 EMA 训练相冲突导致的自我一致性发散;(5)曲折的流动轨迹阻碍了收敛。为解决这些挑战,我们引入了 iSM(improved shortcut models),一个统一的训练框架,系统性地解决每个限制。我们的框架建立在四个关键改进之上:内在引导(Intrinsic Guidance)提供对引导强度的显式、动态控制,解决复合引导和僵化问题;多级小波损失(Multi-Level Wavelet Loss)缓解频率偏置,恢复高频细节;比例最优传输(Scaling Optimal Transport, sOT)减少训练方差并学习更直线、更稳定的生成路径;最后,双 EMA 策略(Twin EMA strategy)解决训练稳定性与自我一致性之间的冲突。在 ImageNet 256x256 上的大量实验表明,我们的方法在一步、少步和多步生成方面均显著改善了 FID 指标,使快捷模型成为一种可行且具竞争力的生成模型范式。
引用
@article{arxiv.2510.21250,
title = {Improved Training Technique for Shortcut Models},
author = {Anh Nguyen and Viet Nguyen and Duc Vu and Trung Dao and Chi Tran and Toan Tran and Anh Tran},
journal= {arXiv preprint arXiv:2510.21250},
year = {2025}
}
备注
Accepted at NeurIPS 2025