中文

Culture-TRIP:基于迭代提示优化的文化感知文本到图像生成

计算机视觉与模式识别 2025-05-20 v2 人工智能

摘要

包括 Stable Diffusion 在内的文本到图像模型在生成与给定提示高度语义对齐的图像方面有了显著改善。然而,现有模型可能无法为在西方文化中不太知名或代表性不足的文化概念或物体(例如“hangari”(韩国器皿))生成合适的图像。在本文中,我们提出了一种新方法 Culture-TRIP(基于迭代提示优化的文化感知文本到图像生成),该方法通过优化提示来改善文本到图像模型中图像与这些文化名词的对齐度。我们的方法(1)检索与提示中文化名词相关的文化语境和视觉细节,并(2)基于一组文化标准和大语言模型迭代地优化和评估提示。优化过程利用了从 Wikipedia 和 Web 检索到的信息。我们对来自八个不同国家的 66 名参与者进行的用户调查表明,我们提出的方法增强了图像与提示之间的对齐度。特别是,C-TRIP 展示了生成的图像与代表性不足的文化名词之间更好的对齐度。资源可在 https://shane3606.github.io/Culture-TRIP 找到。

关键词

引用

@article{arxiv.2502.16902,
  title  = {Culture-TRIP: Culturally-Aware Text-to-Image Generation with Iterative Prompt Refinement},
  author = {Suchae Jeong and Inseong Choi and Youngsik Yun and Jihie Kim},
  journal= {arXiv preprint arXiv:2502.16902},
  year   = {2025}
}

备注

31 pages, 23 figures, Accepted by NAACL 2025