中文

文本锚定分数组合:解决文本到图像扩散模型中的条件错位问题

计算机视觉与模式识别 2024-07-16 v3

摘要

文本到图像扩散模型已通过支持文本之外的各种附加条件(如深度图、边界框)朝着更可控的生成方向演进。然而,这些模型的学习基于文本与额外条件完美对齐的前提。若不满足该对齐,最终输出可能被某一条件主导,或产生歧义,无法符合用户预期。为解决此问题,我们提出一种无需训练的方法——文本锚定分数组合(TASC),在提供部分对齐条件时进一步提升现有模型的可控性。TASC首先基于成对关系分离条件,对每一对单独计算结果,从而确保每对不再具有冲突条件。随后我们提出一种注意力重对齐操作,通过交叉注意力机制将这些独立计算的结果重新对齐,以避免在合并时产生新冲突。定性与定量结果均证明了我们的方法在处理未对齐条件时的有效性,其优于近期方法,更重要的是为可控图像生成过程增添了灵活性。我们的代码将发布于:https://github.com/EnVision-Research/Decompose-and-Realign。

关键词

引用

@article{arxiv.2306.14408,
  title  = {Text-Anchored Score Composition: Tackling Condition Misalignment in Text-to-Image Diffusion Models},
  author = {Luozhou Wang and Guibao Shen and Wenhang Ge and Guangyong Chen and Yijun Li and Ying-cong Chen},
  journal= {arXiv preprint arXiv:2306.14408},
  year   = {2024}
}