中文

扩散模型是否学习到语义上有意义且高效的表示?

机器学习 2024-05-01 v2 人工智能 计算机视觉与模式识别

摘要

扩散模型能够生成令人印象深刻的图像,其中包含不寻常的并置,例如宇航员在月球上骑马,且阴影位置正确。这些输出表明其具备组合泛化的能力,但模型是如何做到这一点的呢?我们对学习生成以指定 xxyy 位置为中心的二维球形高斯凸起的条件 DDPM 进行了受控实验。我们的结果表明,语义上有意义的潜在表示的出现是实现高性能的关键。在学习过程中成功达到高性能的路径上,模型经历了三个不同的潜在表示阶段:(阶段 A)无潜在结构,(阶段 B)无序状态的二维流形,以及(阶段 C)有序的二维流形。与每个阶段相对应,我们识别出性质不同的生成行为:1)生成多个凸起,2)生成一个凸起但位于不准确的 xxyy 位置,3)在正确的 xxyy 位置生成一个凸起。此外,我们表明,即使在特征(xx 位置与 yy 位置)以偏斜频率表示的不平衡数据集下,xxyy 的学习过程也是耦合的而非分解的,这证明了简单的普通风格扩散模型无法学习到高效的表示,即无法将 xxyy 的定位分解为独立的一维任务。这些发现表明,未来的工作需要寻找归纳偏置,以推动生成模型发现并利用其输入中可分解的独立结构,这对于将这些模型提升到更高数据效率的范畴将是必需的。

关键词

引用

@article{arxiv.2402.03305,
  title  = {Do Diffusion Models Learn Semantically Meaningful and Efficient Representations?},
  author = {Qiyao Liang and Ziming Liu and Ila Fiete},
  journal= {arXiv preprint arXiv:2402.03305},
  year   = {2024}
}

备注

13 pages, 9 figures