中文

Beyond Aesthetics: 文本到图像模型的文化素养

计算机视觉与模式识别 2025-01-22 v6

摘要

文本到图像 (Text-to-Image, T2I) 模型正在被广泛应用于不同地区的社区中,以呈现其独特文化的视觉表征。当前的 T2I 基准主要关注生成图像的忠实性、审美和真实性,忽略了文化素养这一关键维度。本文引入了一个框架,用于评估 T2I 模型的文化素养,沿着两个关键维度:文化意识和文化多样性。我们提出了一种可扩展的方法,结合结构知识库和大型语言模型,以构建大型数据集的文化遗产,以实现此评估。具体而言,我们应用了这种方法构建了 CUBE (CUltural BEnchmark for Text-to-Image models),这是第一个用于评估 T2I 模型文化素养的基准。CUBE 覆盖了8个不同地区文化遗产,涉及3个概念:菜系、地标和艺术。CUBE 包含1) CUBE-1K,一组高质量提示,用于评估文化意识,以及2) CUBE-CSpace,一个更大的数据集,作为评估文化多样性的依据。我们还引入了将文化多样性作为一种新型 T2I 评估组件,利用质量加权的 Vendi 分数。我们的评估揭示了现有模型在各国文化意识方面的显著差距,并为 under-specified 提示下 T2I 输出的文化多样性提供了宝贵的见解。我们的方法可扩展至其他文化地区和概念,促进开发更适应全球人群的 T2I 模型。

关键词

引用

@article{arxiv.2407.06863,
  title  = {Beyond Aesthetics: Cultural Competence in Text-to-Image Models},
  author = {Nithish Kannen and Arif Ahmad and Marco Andreetto and Vinodkumar Prabhakaran and Utsav Prabhu and Adji Bousso Dieng and Pushpak Bhattacharyya and Shachi Dave},
  journal= {arXiv preprint arXiv:2407.06863},
  year   = {2025}
}

备注

NeurIPS 2024 camera-ready version