Magnet:我们从未真正理解文本到图像扩散模型,直到我们学会视觉语言模型如何运作
计算机视觉与模式识别
2024-10-01 v1
摘要
文本到图像扩散模型,特别是Stable Diffusion,已经彻底改变了计算机视觉领域。然而,当要求生成忠实表示涉及多个属性和对象的复杂提示的图像时,合成质量往往会下降。虽然先前的研究表明混合文本嵌入会导致不正确的属性绑定,但很少有人对此进行深入探索。在这项工作中,我们批判性地审视了CLIP文本编码器在理解属性方面的局限性,并研究了这如何影响扩散模型。我们在文本空间中辨别出一种属性偏差现象,并强调了填充嵌入中纠缠不同概念的上下文问题。我们提出了\textbf{Magnet},一种新颖的免训练方法,以解决属性绑定问题。我们引入了正绑定向量和负绑定向量来增强解缠结,并进一步采用邻域策略来提高准确性。大量实验表明,Magnet以可忽略的计算成本显著提高了合成质量和绑定准确性,使得生成非常规和非自然的概念成为可能。
引用
@article{arxiv.2409.19967,
title = {Magnet: We Never Know How Text-to-Image Diffusion Models Work, Until We Learn How Vision-Language Models Function},
author = {Chenyi Zhuang and Ying Hu and Pan Gao},
journal= {arXiv preprint arXiv:2409.19967},
year = {2024}
}
备注
Accepted to NeurIPS 2024. Code is available at https://github.com/I2-Multimedia-Lab/Magnet