中文

通过自动提示优化提升文本到图像一致性

计算机视觉与模式识别 2024-03-27 v1 计算与语言

摘要

文本到图像(T2I)生成模型取得了显著进展,已产生大量高性能模型,能够生成具有审美吸引力且具备照片般真实感的图像。尽管已取得进展,这些模型仍在生成与输入提示一致的图像方面存在挑战,常常未能正确捕获物体数量、关系和属性。现有改善提示-图像一致性的解决方案面临以下挑战:(1)通常需要模型微调,(2)仅关注附近的提示样本,(3)在图像质量、表示多样性和提示-图像一致性之间受到不利权衡的影响。本文针对这些挑战,提出了一种基于提示优化的T2I框架,OPT2I,该框架利用大语言模型(LLM)来提高文本到图像模型中的提示-图像一致性。我们的框架从用户提示开始,迭代生成修订后的提示,以最大化一致性得分。我们在两个数据集MSCOCO和PartiPrompts上的广泛验证表明,OPT2I在DSG得分上可将初始一致性得分提高最高24.9%,同时保持FID并提高生成图像与真实数据之间的召回率。我们的工作为通过利用LLM的力量,构建更可靠和稳健的T2I系统铺平了道路。

关键词

引用

@article{arxiv.2403.17804,
  title  = {Improving Text-to-Image Consistency via Automatic Prompt Optimization},
  author = {Oscar Mañas and Pietro Astolfi and Melissa Hall and Candace Ross and Jack Urbanek and Adina Williams and Aishwarya Agrawal and Adriana Romero-Soriano and Michal Drozdzal},
  journal= {arXiv preprint arXiv:2403.17804},
  year   = {2024}
}