文化交汇:多元文化文本到图像生成
计算机视觉与模式识别
2026-04-20 v2 人工智能
摘要
文本到图像生成模型在文化同质化环境中取得了强大的性能,但其在生成跨文化场景(即来自不同文化的人物与地标)方面的能力仍基本未被探索。我们提出了多元文化文本到图像生成作为一个新任务,并构建了第一个专门研究此设定的基准数据集。该数据集包含9,000张图像,涵盖五个国家、三个年龄段、两个性别、25个历史地标以及五种语言。利用该基准,我们分析了领先文本到图像模型在多个维度上的表现,包括对齐性、图像质量、美学、知识以及公平性。作为组合文化和人口学信息的一种策略,我们探索了MosAIG——一种多智能体框架,通过利用具有不同文化人格的大语言模型来增强多元文化图像生成。我们的分析表明,更丰富的提示词组合相对于简单提示词能够提升图像质量和文化 grounding,而且在语言和人口学群体之间存在显著差异。我们将在 https://github.com/AIM-SCU/MosAIG 上发布数据集和代码。
引用
@article{arxiv.2502.15972,
title = {When Cultures Meet: Multicultural Text-to-Image Generation},
author = {Parth Bhalerao and Mounika Yalamarty and Brian Trinh and Oana Ignat},
journal= {arXiv preprint arXiv:2502.15972},
year = {2026}
}