中文

预训练扩散模型h空间中可解释方向的无监督发现

计算机视觉与模式识别 2023-12-01 v3 机器学习

摘要

我们提出了第一种无监督且基于学习的方法,用于在预训练扩散模型的h空间中识别可解释方向。我们的方法源自一种在GAN潜空间上操作的现有技术。具体而言,我们采用一个作用于预训练扩散模型h空间的偏移控制模块,将样本操作为自身的偏移版本,随后由重建器复现该操作的类型和强度。通过联合优化它们,模型将自发发现解耦且可解释的方向。为防止发现无意义及破坏性的方向,我们采用判别器来维持偏移样本的保真度。由于扩散模型的迭代生成过程,我们的训练需要大量GPU显存来存储众多中间张量以反向传播梯度。为解决此问题,我们提出了一种基于梯度检查点技术的通用显存高效训练算法,以通过整个生成过程反向传播任意梯度,且显存占用可接受、训练效率有所牺牲。与扩散模型上现有相关工作相比,我们的方法固有地识别全局且可缩放的方向,无需任何其它复杂步骤。在多个数据集上的大量实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.2310.09912,
  title  = {Unsupervised Discovery of Interpretable Directions in h-space of Pre-trained Diffusion Models},
  author = {Zijian Zhang and Luping Liu and Zhijie Lin and Yichen Zhu and Zhou Zhao},
  journal= {arXiv preprint arXiv:2310.09912},
  year   = {2023}
}