通过硬绑定与软细化的区域感知文本到图像生成
计算机视觉与模式识别
2024-11-19 v2
摘要
区域提示(或组合生成)能够实现细粒度的空间控制,因其在实际应用中的实用性而受到越来越多的关注。然而,此前的方法要么引入额外的可训练模块,因此仅适用于特定模型,要么在交叉注意力层中使用注意力掩码操作分数图,导致当区域数量增加时控制能力有限。为应对这些局限,我们提出了RAG——一种以区域描述为条件的区域感知文本到图像生成方法,用于精确的布局组合。RAG将多区域生成解耦为两个子任务:构建单个区域(区域硬绑定),确保区域提示得到正确执行;以及跨区域的整体细节细化(区域软细化),消除视觉边界并增强相邻交互。此外,RAG首次使重绘成为可能,用户可以在上次生成的基础上修改特定不满足的区域,同时保持所有其他区域不变,而无需依赖额外的图像修复模型。我们的方法无需微调,可作为提示遵循能力的增强模块应用于其他框架。定量和定性实验表明,RAG在属性绑定和对象关系方面优于此前无需微调的方法。
引用
@article{arxiv.2411.06558,
title = {Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement},
author = {Zhennan Chen and Yajie Li and Haofan Wang and Zhibo Chen and Zhengkai Jiang and Jun Li and Qian Wang and Jian Yang and Ying Tai},
journal= {arXiv preprint arXiv:2411.06558},
year = {2024}
}
备注
Code is available at https://github.com/NJU-PCALab/RAG-Diffusion