中文

深度生成图像模型的几何结构及其应用

机器学习 2021-03-19 v2 数值分析 神经与进化计算 数值分析

摘要

生成对抗网络(GANs)已成为一种强大的无监督方法,用于建模真实世界数据集(如自然图像)的统计模式。这些网络被训练为将其潜在空间中的随机输入映射为代表所学数据的新样本。然而,由于潜在空间的高维性以及生成器的非线性,其结构难以直观理解,这限制了模型的实用性。理解潜在空间需要一种为现有真实图像识别输入编码的方法(反演),以及一种识别具有已知图像变换方向的方法(可解释性)。在此,我们使用一个几何框架同时解决这两个问题。我们开发了一种与架构无关的方法来计算由 GAN 生成的图像流形的黎曼度量。该度量的特征分解分离出解释不同图像变异程度的轴。对多个预训练 GAN 的实证分析表明,每个位置附近的图像变化集中在极少的主要轴上(空间高度各向异性),且造成这种大变化的方向在空间不同位置相似(空间均匀)。我们展示许多顶部特征向量对应于图像空间中可解释的变换,而特征空间的很大一部分对应于可被压缩掉的微小变换。这种几何理解统一了先前与 GAN 可解释性相关的关键结果。我们表明,该度量的使用可实现潜在空间中更高效的优化(例如 GAN 反演),并有助于可解释轴的无监督发现。我们的结果说明,定义 GAN 图像流形的几何结构可作为理解 GAN 的通用框架。

关键词

引用

@article{arxiv.2101.06006,
  title  = {The Geometry of Deep Generative Image Models and its Applications},
  author = {Binxu Wang and Carlos R. Ponce},
  journal= {arXiv preprint arXiv:2101.06006},
  year   = {2021}
}

备注

25 pages, 11 figures. Published as a conference paper at ICLR 2021