中文

在扩散模型的语义潜空间中发掘可解释方向

计算机视觉与模式识别 2024-05-30 v2 机器学习

摘要

去噪扩散模型(DDMs)已成为生成对抗网络(GANs)的有力竞争者。然而,尽管它们广泛用于图像合成与编辑应用,其潜空间仍未被充分理解。最近,一种称为“hh-空间”的 DDM 语义潜空间被证明能以类似 GAN 的方式促进语义图像编辑。hh-空间由扩散过程所有时间步上 DDM 去噪器中的瓶颈激活构成。本文中,我们探究 h-空间的性质,并提出几种在其中寻找有意义语义方向的新方法。我们首先研究在预训练 DDM 中揭示可解释语义方向的无监督方法。具体而言,我们展示全局潜方向作为潜空间中的主成分涌现。此外,我们提供一种通过对去噪器关于潜码的雅可比矩阵进行谱分析来发现图像特定语义方向的新方法。接下来,我们通过无条件的 DDM 中有监督地寻找方向来扩展分析。我们展示了如何借助真实图像的带标签数据集或通过领域特定属性分类器标注生成样本来找到此类方向。我们进一步展示如何通过简单线性投影对所得方向进行语义解耦。我们的方法无需任何架构修改、基于文本的引导、基于 CLIP 的优化或模型微调即可应用。

关键词

引用

@article{arxiv.2303.11073,
  title  = {Discovering Interpretable Directions in the Semantic Latent Space of Diffusion Models},
  author = {René Haas and Inbar Huberman-Spiegelglas and Rotem Mulayoff and Stella Graßhof and Sami S. Brandt and Tomer Michaeli},
  journal= {arXiv preprint arXiv:2303.11073},
  year   = {2024}
}