R&B:面向零样本接地文本到图像生成的区域与边界感知方法
计算机视觉与模式识别
2023-11-28 v5
摘要
近期的文本到图像(T2I)扩散模型在给定文本提示作为输入时生成高质量图像方面取得了显著进展。然而,这些模型未能传达由布局指令指定的恰当空间组合。本文中,我们探究使用扩散模型的零样本接地 T2I 生成,即在不训练辅助模块或微调扩散模型的情况下,生成与输入布局信息相对应的图像。我们提出一种区域与边界(R&B)感知的交叉注意力引导方法,在生成过程中逐步调制扩散模型的注意力图,并辅助模型合成(1)高保真度、(2)与文本输入高度兼容、且(3)准确解读布局指令的图像。具体而言,我们利用离散采样弥合连续注意力图与离散布局约束之间的鸿沟,并设计区域感知损失以在扩散过程中精炼生成布局。我们进一步提出边界感知损失以加强相应区域内物体的可判别性。实验结果表明,在多个基准上,我们的方法在定性与定量上均大幅优于现有的最先进零样本接地 T2I 生成方法。
引用
@article{arxiv.2310.08872,
title = {R&B: Region and Boundary Aware Zero-shot Grounded Text-to-image Generation},
author = {Jiayu Xiao and Henglei Lv and Liang Li and Shuhui Wang and Qingming Huang},
journal= {arXiv preprint arXiv:2310.08872},
year = {2023}
}
备注
Preprint. Under review. Project page: https://sagileo.github.io/Region-and-Boundary