Zero-Painter:面向文本到图像合成的无训练布局控制
计算机视觉与模式识别
2024-06-07 v1
摘要
我们提出Zero-Painter,一种新颖的无训练框架,用于布局条件文本到图像合成,便于从文本提示创建细节丰富且受控的图像。我们的方法利用对象掩码和个体描述,结合全局文本提示,生成高保真图像。Zero-Painter采用两阶段过程,包括我们新颖的提示调整交叉注意力(PACA)和区域分组交叉注意力(ReGCA)模块,确保生成对象与文本提示和掩码形状的精确对齐。大量实验表明,Zero-Painter在保留文本细节和遵循掩码形状方面超越了当前最先进的方法。
引用
@article{arxiv.2406.04032,
title = {Zero-Painter: Training-Free Layout Control for Text-to-Image Synthesis},
author = {Marianna Ohanyan and Hayk Manukyan and Zhangyang Wang and Shant Navasardyan and Humphrey Shi},
journal= {arXiv preprint arXiv:2406.04032},
year = {2024}
}