中文

NoiseCLR:一种用于无监督发现扩散模型中可解释方向的对比学习方法

计算机视觉与模式识别 2023-12-12 v1

摘要

近年来,生成模型因其图像生成能力而备受瞩目。基于 GAN 的模型因其解耦的潜在空间而备受推崇,这是其在受控图像编辑中取得成功的关键特性。另一方面,扩散模型已成为生成高质量图像的强大工具。然而,扩散模型的潜在空间尚未得到充分的探索与理解。现有旨在探索扩散模型潜在空间的方法通常依赖文本提示来定位特定语义。然而,这种方法在艺术、时尚或医学等专业领域可能具有局限性,因为这些领域可能不存在或难以构思合适的文本提示,从而限制了现有工作的适用范围。在本文中,我们提出了一种无监督方法,无需依赖文本提示即可发现文本到图像扩散模型中的潜在语义。我们的方法从特定领域(如人脸或猫)获取少量无标签图像,并利用预训练的扩散模型,通过对比学习目标以无监督方式发现多样化的语义。此外,学习到的方向可以同时应用,无论是在同一领域内(如各种类型的面部编辑)还是跨不同领域(如在同一图像中应用猫和面部的编辑),均不会相互干扰。我们的大量实验表明,该方法实现了高度解耦的编辑,在基于扩散模型和基于 GAN 的潜在空间编辑方法中均优于现有方法。

关键词

引用

@article{arxiv.2312.05390,
  title  = {NoiseCLR: A Contrastive Learning Approach for Unsupervised Discovery of Interpretable Directions in Diffusion Models},
  author = {Yusuf Dalva and Pinar Yanardag},
  journal= {arXiv preprint arXiv:2312.05390},
  year   = {2023}
}

备注

Project page: https://noiseclr.github.io/