TIPO:基于文本预采样的提示优化文本到图像生成
计算机视觉与模式识别
2026-02-10 v6
摘要
TIPO(文本到图像提示优化)为文本到图像(T2I)生成引入了一种高效的自动提示优化方法。从简单的用户提示开始,TIPO利用一个轻量级预训练模型将这些提示扩展为更丰富、更详细的版本。从概念上讲,TIPO从更广泛语义空间内的目标子分布中采样优化后的提示,在保留原始意图的同时显著提升视觉质量、连贯性和细节。与基于大型语言模型(LLM)或强化学习(RL)的资源密集型方法不同,TIPO提供了强大的计算效率和可扩展性,为T2I任务中有效的自动化提示工程开辟了新的可能性。跨多个领域的广泛实验表明,TIPO实现了更强的文本对齐、更少的视觉伪影以及持续更高的人类偏好率,同时保持了有竞争力的美学质量。这些结果突显了分布对齐提示工程的有效性,并指向了文本到图像生成中可扩展、自动化优化的更广泛机会。
引用
@article{arxiv.2411.08127,
title = {TIPO: Text to Image with Text Presampling for Prompt Optimization},
author = {Shih-Ying Yeh and Yi Li and Sang-Hyun Park and Giyeong Oh and Xuehai Wang and Min Song and Youngjae Yu and Shang-Hong Lai},
journal= {arXiv preprint arXiv:2411.08127},
year = {2026}
}
备注
50 pages, 28 figures