中文

PrimeComposer:具有注意力引导的更快的渐进组合扩散图像合成

计算机视觉与模式识别 2024-08-21 v3 人工智能

摘要

图像合成涉及将给定对象无缝集成到特定的视觉上下文中。当前的免训练方法依赖于组合来自多个采样器的注意力权重来引导生成器。然而,由于这些权重源自不同的上下文,它们的组合会导致连贯性混淆和外观信息丢失。这些问题因它们过度关注背景生成而加剧,即使在该任务中并不需要背景生成。这不仅阻碍了其快速实施,还损害了前景生成的质量。此外,这些方法在过渡区域引入了不需要的伪影。在本文中,我们将图像合成 formulize 为基于主体的局部编辑任务,仅专注于前景生成。在每一步中,编辑后的前景与噪声背景相结合以维持场景一致性。为解决剩余问题,我们提出了 PrimeComposer,这是一种更快的免训练扩散器,通过精心设计的跨不同噪声水平的注意力引导来合成图像。这种引导主要由我们的相关扩散器(Correlation Diffuser)实现,利用其每一步的自注意力层。在这些层中,合成的主体与参考对象和背景相互作用,捕捉复杂的细节和连贯的关系。这些先验信息被编码到注意力权重中,然后集成到生成器的自注意力层中以指导合成过程。此外,我们引入了区域约束交叉注意力(Region-constrained Cross-Attention),将特定主体相关 token 的影响限制在期望区域内,从而解决先前方法中显示的不需要的伪影,进一步提高了过渡区域的连贯性。我们的方法展现了最快的推理效率,广泛的实验在定性和定量上均证明了我们的优越性。

关键词

引用

@article{arxiv.2403.05053,
  title  = {PrimeComposer: Faster Progressively Combined Diffusion for Image Composition with Attention Steering},
  author = {Yibin Wang and Weizhong Zhang and Jianwei Zheng and Cheng Jin},
  journal= {arXiv preprint arXiv:2403.05053},
  year   = {2024}
}

备注

Accepted by ACMMM2024. Code: https://github.com/CodeGoat24/PrimeComposer