中文

Zero-Painter:面向文本到图像合成的无训练布局控制

计算机视觉与模式识别 2024-06-07 v1

摘要

我们提出Zero-Painter,一种新颖的无训练框架,用于布局条件文本到图像合成,便于从文本提示创建细节丰富且受控的图像。我们的方法利用对象掩码和个体描述,结合全局文本提示,生成高保真图像。Zero-Painter采用两阶段过程,包括我们新颖的提示调整交叉注意力(PACA)和区域分组交叉注意力(ReGCA)模块,确保生成对象与文本提示和掩码形状的精确对齐。大量实验表明,Zero-Painter在保留文本细节和遵循掩码形状方面超越了当前最先进的方法。

关键词

引用

@article{arxiv.2406.04032,
  title  = {Zero-Painter: Training-Free Layout Control for Text-to-Image Synthesis},
  author = {Marianna Ohanyan and Hayk Manukyan and Zhangyang Wang and Shant Navasardyan and Humphrey Shi},
  journal= {arXiv preprint arXiv:2406.04032},
  year   = {2024}
}