中文

CulturalFrames:评估文本到图像模型与评价指标中的文化期望对齐度

计算机视觉与模式识别 2026-01-21 v3 人工智能 计算与语言

摘要

文本到图像(T2I)模型作为视觉内容生成工具的日益普及,引发了人们对其准确呈现多元文化语境能力的担忧——错失文化线索可能会固化刻板印象并损害可用性。在这项工作中,我们首次系统性地量化了 T2I 模型和评价指标在显性(明确陈述的)以及隐性(未明说,由提示的文化语境暗示的)文化期望方面的对齐度。为此,我们引入了 CulturalFrames,一个专为对视觉生成中的文化表征进行严格人类评估而设计的新型基准。CulturalFrames 横跨 10 个国家和 5 个社会文化领域,包含 983 个提示、由 4 个最先进的 T2I 模型生成的 3637 张对应图像,以及超过 1 万条详细的人工标注。我们发现,在不同模型和国家中,文化期望平均有 44% 的情况被错失。在这些失败中,显性期望被错失的平均比率惊人地高达 68%,而隐性期望的失败也很显著,平均为 49%。此外,我们表明,现有的 T2I 评价指标与人类对文化对齐度的判断相关性很差,无论其内部推理如何。总的来说,我们的发现揭示了关键差距,提供了一个具体的测试平台,并概述了开发具有文化意识的 T2I 模型和指标以提升全球可用性的可行方向。

关键词

引用

@article{arxiv.2506.08835,
  title  = {CulturalFrames: Assessing Cultural Expectation Alignment in Text-to-Image Models and Evaluation Metrics},
  author = {Shravan Nayak and Mehar Bhatia and Xiaofeng Zhang and Verena Rieser and Lisa Anne Hendricks and Sjoerd van Steenkiste and Yash Goyal and Karolina Stańczak and Aishwarya Agrawal},
  journal= {arXiv preprint arXiv:2506.08835},
  year   = {2026}
}

备注

Accepted to EMNLP 2025 Findings