中文

Box It to Bind It:T2I 扩散模型中的统一布局控制与属性绑定

计算机视觉与模式识别 2024-02-29 v1

摘要

尽管潜在扩散模型(LDMs)擅长创造富有想象力的图像,但它们往往缺乏语义保真度以及在物体生成位置上的空间控制精度。为解决这些缺陷,我们引入了 Box-it-to-Bind-it (B2B) 模块——一种新颖的、无需训练的方法,旨在提升文本到图像(T2I)扩散模型的空间控制和语义准确性。B2B 针对 T2I 中的三个关键挑战:灾难性忽略、属性绑定和布局引导。该过程包含两个主要步骤:i) 物体生成,调整潜在编码以保证物体生成并将其引导至指定的边界框内;ii) 属性绑定,确保生成的物体遵循提示中指定的属性。B2B 设计为兼容现有 T2I 模型的即插即用模块,显著提升了模型在应对关键挑战方面的性能。我们使用既定的 CompBench 和 TIFA 评分基准评估了该技术,结果表明其性能较现有方法有显著提升。源代码将公开于 https://github.com/nextaistudio/BoxIt2BindIt。

关键词

引用

@article{arxiv.2402.17910,
  title  = {Box It to Bind It: Unified Layout Control and Attribute Binding in T2I Diffusion Models},
  author = {Ashkan Taghipour and Morteza Ghahremani and Mohammed Bennamoun and Aref Miri Rekavandi and Hamid Laga and Farid Boussaid},
  journal= {arXiv preprint arXiv:2402.17910},
  year   = {2024}
}