中文

通过增量向量转换文本嵌入以抑制文生图扩散模型中强纠缠内容

计算机视觉与模式识别 2025-08-19 v2

摘要

文生图(T2I)扩散模型在根据文本提示生成多样化高质量图像方面取得了显著进展。然而,这些模型在抑制与特定词语强纠缠的内容方面仍面临挑战。例如,在生成“查理·卓别林”的图像时,即使明确指示不要包含“胡子”,它也会持续出现,因为“胡子”的概念与“查理·卓别林”强纠缠。为了解决这个问题,我们提出了一种在扩散模型的文本嵌入空间中直接抑制此类纠缠内容的新方法。我们的方法引入了一个增量向量,该向量修改文本嵌入以削弱生成图像中不需要内容的影响,并且我们进一步证明,这种增量向量可以通过零样本方法轻松获得。此外,我们提出了一种基于增量向量的选择性抑制(SSDV)方法,将增量向量适配到交叉注意力机制中,从而能够在原本会生成不需要内容的区域更有效地抑制它。另外,我们通过优化增量向量,在个性化T2I模型中实现了更精确的抑制,这是先前基线方法无法做到的。大量实验结果表明,我们的方法在定量和定性指标上都显著优于现有方法。

关键词

引用

@article{arxiv.2508.10407,
  title  = {Translation of Text Embedding via Delta Vector to Suppress Strongly Entangled Content in Text-to-Image Diffusion Models},
  author = {Eunseo Koh and Seunghoo Hong and Tae-Young Kim and Simon S. Woo and Jae-Pil Heo},
  journal= {arXiv preprint arXiv:2508.10407},
  year   = {2025}
}