让你得到想要的,而不是不想要的:文本到图像扩散模型中的图像内容抑制
计算机视觉与模式识别
2024-02-09 v1
摘要
最近文本到图像扩散模型的成功在很大程度上归因于其能够由复杂文本提示进行引导,从而使用户能够精确描述所需内容。然而,这些模型在有效抑制生成图像中不希望出现的内容方面仍然困难,这些内容在提示中被明确要求省略。本文分析了如何操作文本嵌入以消除不希望的内容。我们提出了两项贡献,称为“软加权正则化”和“推理时文本嵌入优化”。前者正则化文本嵌入矩阵,有效抑制不希望的内容。后者旨在进一步抑制提示中不希望生成的内容,同时鼓励生成所需内容。我们在大量实验中对方法进行了定性和定量评估,验证了其有效性。此外,我们的方法对像空间扩散模型(如 DeepFloyd-IF)和潜在空间扩散模型(如 Stable Diffusion)均具有通用性。
引用
@article{arxiv.2402.05375,
title = {Get What You Want, Not What You Don't: Image Content Suppression for Text-to-Image Diffusion Models},
author = {Senmao Li and Joost van de Weijer and Taihang Hu and Fahad Shahbaz Khan and Qibin Hou and Yaxing Wang and Jian Yang},
journal= {arXiv preprint arXiv:2402.05375},
year = {2024}
}
备注
ICLR 2024. Our code is available in https://github.com/sen-mao/SuppressEOT