中文

TIPO:基于文本预采样的提示优化文本到图像生成

计算机视觉与模式识别 2026-02-10 v6

摘要

TIPO(文本到图像提示优化)为文本到图像(T2I)生成引入了一种高效的自动提示优化方法。从简单的用户提示开始,TIPO利用一个轻量级预训练模型将这些提示扩展为更丰富、更详细的版本。从概念上讲,TIPO从更广泛语义空间内的目标子分布中采样优化后的提示,在保留原始意图的同时显著提升视觉质量、连贯性和细节。与基于大型语言模型(LLM)或强化学习(RL)的资源密集型方法不同,TIPO提供了强大的计算效率和可扩展性,为T2I任务中有效的自动化提示工程开辟了新的可能性。跨多个领域的广泛实验表明,TIPO实现了更强的文本对齐、更少的视觉伪影以及持续更高的人类偏好率,同时保持了有竞争力的美学质量。这些结果突显了分布对齐提示工程的有效性,并指向了文本到图像生成中可扩展、自动化优化的更广泛机会。

关键词

引用

@article{arxiv.2411.08127,
  title  = {TIPO: Text to Image with Text Presampling for Prompt Optimization},
  author = {Shih-Ying Yeh and Yi Li and Sang-Hyun Park and Giyeong Oh and Xuehai Wang and Min Song and Youngjae Yu and Shang-Hong Lai},
  journal= {arXiv preprint arXiv:2411.08127},
  year   = {2026}
}

备注

50 pages, 28 figures