揭示文本到图像扩散模型的解耦能力
计算机视觉与模式识别
2022-12-20 v1
摘要
生成模型在计算机视觉领域已被广泛研究。近期,扩散模型因其生成图像的高质量而备受关注。图像生成模型的一个关键期望属性是能够解耦不同属性,这应使得在不改变语义内容的情况下向某种风格进行修改,且修改参数应能泛化至不同图像。先前的研究发现,生成对抗网络(GAN)本身具备这种解耦能力,因此无需重新训练或微调网络即可执行解耦图像编辑。在本工作中,我们探讨扩散模型是否也本身具备这样的能力。我们的发现是,对于 stable diffusion 模型,通过将输入文本嵌入从中性描述(例如“a photo of person”)部分改变为带有风格的描述(例如“a photo of person with smile”),同时固定去噪过程中引入的所有高斯随机噪声,可以在不改变语义内容的情况下将生成图像向目标风格修改。基于这一发现,我们进一步提出了一种简单、轻量级的图像编辑算法,其中优化两种文本嵌入的混合权重以实现风格匹配和内容保留。整个过程仅涉及优化约 50 个参数,且不对扩散模型本身进行微调。实验表明,所提出的方法能够修改多种属性,其性能优于需要微调的基于扩散模型的图像编辑算法。优化后的权重能很好地泛化至不同图像。我们的代码已在 https://github.com/UCSB-NLP-Chang/DiffusionDisentanglement 公开。
引用
@article{arxiv.2212.08698,
title = {Uncovering the Disentanglement Capability in Text-to-Image Diffusion Models},
author = {Qiucheng Wu and Yujian Liu and Handong Zhao and Ajinkya Kale and Trung Bui and Tong Yu and Zhe Lin and Yang Zhang and Shiyu Chang},
journal= {arXiv preprint arXiv:2212.08698},
year = {2022}
}
备注
23 pages, 18 figures