中文

通过硬绑定与软细化的区域感知文本到图像生成

计算机视觉与模式识别 2024-11-19 v2

摘要

区域提示(或组合生成)能够实现细粒度的空间控制,因其在实际应用中的实用性而受到越来越多的关注。然而,此前的方法要么引入额外的可训练模块,因此仅适用于特定模型,要么在交叉注意力层中使用注意力掩码操作分数图,导致当区域数量增加时控制能力有限。为应对这些局限,我们提出了RAG——一种以区域描述为条件的区域感知文本到图像生成方法,用于精确的布局组合。RAG将多区域生成解耦为两个子任务:构建单个区域(区域硬绑定),确保区域提示得到正确执行;以及跨区域的整体细节细化(区域软细化),消除视觉边界并增强相邻交互。此外,RAG首次使重绘成为可能,用户可以在上次生成的基础上修改特定不满足的区域,同时保持所有其他区域不变,而无需依赖额外的图像修复模型。我们的方法无需微调,可作为提示遵循能力的增强模块应用于其他框架。定量和定性实验表明,RAG在属性绑定和对象关系方面优于此前无需微调的方法。

关键词

引用

@article{arxiv.2411.06558,
  title  = {Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement},
  author = {Zhennan Chen and Yajie Li and Haofan Wang and Zhibo Chen and Zhengkai Jiang and Jun Li and Qian Wang and Jian Yang and Ying Tai},
  journal= {arXiv preprint arXiv:2411.06558},
  year   = {2024}
}

备注

Code is available at https://github.com/NJU-PCALab/RAG-Diffusion