预训练扩散模型h空间中可解释方向的无监督发现
计算机视觉与模式识别
2023-12-01 v3 机器学习
摘要
我们提出了第一种无监督且基于学习的方法,用于在预训练扩散模型的h空间中识别可解释方向。我们的方法源自一种在GAN潜空间上操作的现有技术。具体而言,我们采用一个作用于预训练扩散模型h空间的偏移控制模块,将样本操作为自身的偏移版本,随后由重建器复现该操作的类型和强度。通过联合优化它们,模型将自发发现解耦且可解释的方向。为防止发现无意义及破坏性的方向,我们采用判别器来维持偏移样本的保真度。由于扩散模型的迭代生成过程,我们的训练需要大量GPU显存来存储众多中间张量以反向传播梯度。为解决此问题,我们提出了一种基于梯度检查点技术的通用显存高效训练算法,以通过整个生成过程反向传播任意梯度,且显存占用可接受、训练效率有所牺牲。与扩散模型上现有相关工作相比,我们的方法固有地识别全局且可缩放的方向,无需任何其它复杂步骤。在多个数据集上的大量实验证明了我们方法的有效性。
引用
@article{arxiv.2310.09912,
title = {Unsupervised Discovery of Interpretable Directions in h-space of Pre-trained Diffusion Models},
author = {Zijian Zhang and Luping Liu and Zhijie Lin and Yichen Zhu and Zhou Zhao},
journal= {arXiv preprint arXiv:2310.09912},
year = {2023}
}