通过渐进提示提升图像生成保真度
计算机视觉与模式识别
2025-01-14 v1
摘要
扩散变换器 (DiT) 架构在图像生成中吸引了广泛关注,实现了更好的保真度、性能和多样性。然而,大多数现有的 DiT 基于图像生成方法关注全局感知合成,区域提示控制较少被探索。本文提出了一种面向区域提示的粗到细生成管道。具体而言,我们首先利用强大的大型语言模型 (LLM) 生成图像的高层次描述(如内容、主题和对象)以及低层次描述(如细节和风格)。随后,我们探讨了不同深度交叉注意力层的影响。我们发现更深的层始终负责高层次内容控制,而浅层处理低层次内容控制。将各种提示注入我们提出的区域交叉注意力控制,以实现粗到细生成。通过使用我们提出的管道,我们增强了 DiT 基于图像生成的可控性。广泛的定量和定性结果表明,我们的管道可以提高生成图像的性能。
引用
@article{arxiv.2501.07070,
title = {Enhancing Image Generation Fidelity via Progressive Prompts},
author = {Zhen Xiong and Yuqi Li and Chuanguang Yang and Tiao Tan and Zhihong Zhu and Siyuan Li and Yue Ma},
journal= {arXiv preprint arXiv:2501.07070},
year = {2025}
}
备注
Accepted by ICASSP 2025, Github: https://github.com/ZhenXiong-dl/ICASSP2025-RCAC