中文

理解生成模型中的平坦性:其作用与益处

计算机视觉与模式识别 2025-08-07 v2 机器学习

摘要

平坦极小值已知能增强监督学习中的泛化能力和鲁棒性,但在生成模型中仍未被充分探索。在这项工作中,我们从理论和经验上系统地研究了生成模型中损失表面平坦性的作用,特别关注扩散模型。我们建立了一个理论主张,即更平坦的极小值提高了对目标先验分布扰动的鲁棒性,带来了诸如减少暴露偏差(即噪声估计中的误差在迭代中累积)等益处,并显著增强了对模型量化的适应能力,即使在强量化约束下也能保持生成性能。我们进一步观察到,显式控制平坦程度的 Sharpness-Aware Minimization (SAM) 有效地增强了扩散模型中的平坦性,甚至超越了间接促进平坦性的方法——强制执行 Lipschitz 条件的输入扰动 (IP),以及基于集成的方法如随机权重平均 (SWA) 和指数移动平均 (EMA)——这些方法效果较差。通过在 CIFAR-10、LSUN Tower 和 FFHQ 上的大量实验,我们证明了扩散模型中的平坦极小值不仅确实提高了生成性能,还提高了鲁棒性。

关键词

引用

@article{arxiv.2503.11078,
  title  = {Understanding Flatness in Generative Models: Its Role and Benefits},
  author = {Taehwan Lee and Kyeongkook Seo and Jaejun Yoo and Sung Whan Yoon},
  journal= {arXiv preprint arXiv:2503.11078},
  year   = {2025}
}