端到端扩散隐变量优化改进分类器引导
计算机视觉与模式识别
2023-06-02 v2 人工智能
机器学习
摘要
分类器引导——利用图像分类器的梯度来引导扩散模型的生成——具有大幅扩展图像生成与编辑中创造性控制的潜力。然而,当前的分类器引导要么需要训练新的噪声感知模型以获得准确梯度,要么使用最终生成的一步去噪近似,这导致梯度错位与控制次优。我们指出了该近似的缺陷,并提出了一种新颖的引导方法:扩散隐变量直接优化(DOODL),其通过使用可逆扩散过程实现内存高效的反向传播,针对真实生成像素上预训练分类器的梯度优化扩散隐变量,从而实现即插即用的引导。为展示更精确引导的潜力,DOODL在不同形式的引导上均优于一步分类器引导,涵盖计算与人工评价指标:使用CLIP引导改进DrawBench中复杂提示的生成,使用细粒度视觉分类器扩展Stable Diffusion的词汇量,实现基于CLIP视觉编码器的图像条件生成,以及使用美学评分网络改善图像美感。代码见 https://github.com/salesforce/DOODL。
引用
@article{arxiv.2303.13703,
title = {End-to-End Diffusion Latent Optimization Improves Classifier Guidance},
author = {Bram Wallace and Akash Gokul and Stefano Ermon and Nikhil Naik},
journal= {arXiv preprint arXiv:2303.13703},
year = {2023}
}