中文

你的流形藏着什么秘密?理解生成模型的局部几何

机器学习 2025-02-07 v2 计算机视觉与模式识别

摘要

深度生成模型经常用于使用有限数量的样本来学习复杂数据分布的连续表示。对于任何生成模型,包括具有扩散或 Transformer 架构的预训练基础模型,生成性能在所学习的数据流形上可能显著变化。在本文中,我们研究了所学习流形的局部几何及其与生成结果之间的关系,涵盖广泛的生成模型,包括 DDPM、扩散 Transformer (DiT) 和 Stable Diffusion 1.4。基于连续分段线性 (CPWL) 生成器的理论,我们以三种几何描述子来刻画局部几何——尺度 (ψ\psi)、秩 (ν\nu) 和复杂度/不光滑性 (δ\delta)。我们提供的定量和定性证据表明,对于给定的潜在-图像对,局部描述子能够指示生成模型的生成美学、多样性和记忆。最后,我们展示,通过在 Stable Diffusion 上训练局部尺度奖励模型,我们可以使用基于“几何奖励”的引导在去噪过程中自我提升生成的美学和多样性。

关键词

引用

@article{arxiv.2408.08307,
  title  = {What Secrets Do Your Manifolds Hold? Understanding the Local Geometry of Generative Models},
  author = {Ahmed Imtiaz Humayun and Ibtihel Amara and Cristina Vasconcelos and Deepak Ramachandran and Candice Schumann and Junfeng He and Katherine Heller and Golnoosh Farnadi and Negar Rostamzadeh and Mohammad Havaei},
  journal= {arXiv preprint arXiv:2408.08307},
  year   = {2025}
}

备注

Accepted for publication at ICLR 2025