中文

扩散模型从全局视角:它们在文化包容性方面如何?

计算机视觉与模式识别 2025-06-26 v2 人工智能

摘要

文本到图像扩散模型最近使能够从文本提示创建视觉上引人入目、细致的图像。然而,它们准确表示各种文化细微差别的能力仍是未知问题。我们引入CultDiff基准,评估最先进的扩散模型是否能够生成跨越十个国家的文化特定图像。我们展示,这些模型通常无法生成建筑、服饰和食物中的文化性制品,尤其是针对代表性不足的国家地区,通过对不同相似性方面进行细粒度分析,揭示了在文化相关性、描述忠实度和真实性方面与真实世界参考图像之间存在显著差异。通过收集的人类评估,我们开发了一种基于神经网络的图像-图像相似度指标,即CultDiff-S,用于预测人类对具有文化性制品的真实图像和生成图像的判断。我们的工作凸显了需要更具包容性的生成式AI系统以及在广泛文化范围内的公平数据表示的必要性。

关键词

引用

@article{arxiv.2502.08914,
  title  = {Diffusion Models Through a Global Lens: Are They Culturally Inclusive?},
  author = {Zahra Bayramli and Ayhan Suleymanzade and Na Min An and Huzama Ahmad and Eunsu Kim and Junyeong Park and James Thorne and Alice Oh},
  journal= {arXiv preprint arXiv:2502.08914},
  year   = {2025}
}

备注

17 pages, 17 figures, 3 tables