保持自我:面向多主体文本到图像生成的有界注意力
计算机视觉与模式识别
2024-03-26 v1 人工智能
图形学
机器学习
摘要
文本到图像扩散模型具有前所未有的生成多样且高质量图像的能力。然而,它们往往难以忠实捕捉包含多个主体的复杂输入提示的预期语义。最近,引入了许多布局到图像的扩展以改善用户控制,旨在定位由特定标记表示的主体。然而,这些方法经常产生语义不准确的图像,特别是在处理多个语义或视觉上相似的主体时。在这项工作中,我们研究并分析了这些限制的原因。我们的探索表明,主要问题源于去噪过程中主体之间无意的语义泄漏。这种泄漏归因于扩散模型的注意力层,这些层倾向于混合不同主体的视觉特征。为了解决这些问题,我们引入了 Bounded Attention,一种在采样过程中限制信息流的无训练方法。Bounded Attention 防止了主体之间有害的泄漏,并能够引导生成以促进每个主体的个性,即使在复杂的多主体条件下也是如此。通过广泛的实验,我们证明我们的方法能够生成多个主体,且更好地与给定的提示和布局对齐。
引用
@article{arxiv.2403.16990,
title = {Be Yourself: Bounded Attention for Multi-Subject Text-to-Image Generation},
author = {Omer Dahary and Or Patashnik and Kfir Aberman and Daniel Cohen-Or},
journal= {arXiv preprint arXiv:2403.16990},
year = {2024}
}
备注
Project page: https://omer11a.github.io/bounded-attention/