中文

利用社区知情量表评估 AI 生成的文化制品图像

计算机与社会 2026-05-19 v2

摘要

测量对于提升 AI 性能和减轻对边缘群体的危害至关重要。随着生成式 AI 系统在地理和情境上快速部署,AI 测量实践必须设计为支持在不同模型、数据集和评估设置下可重复、可自动化的应用。然而,自动化测量的驱动力可能与测量工具捕捉受 AI 影响社区专业知识和视角的能力产生冲突。近期工作倡导将测量分解为若干关键阶段:首先从待测量的抽象概念转化为精确的'系统化'概念;接着将系统化概念操作化为具体的测量工具;最后将测量工具应用于数据以产生测量结果。这为将社区参与集中在系统化阶段提供了机会,然后再进行操作化和应用。在本文中,我们探讨了如何通过与三个社区的案例研究,将'文化适当性'这一概念在文本到图像模型对文化重要制品的表征中进行系统化:英国的低视力和盲人居民、喀拉拉邦居民以及泰米尔纳德邦居民。我们的系统化概念反映了社区成员与每件制品互动的亲身经历以及他们希望自身物质文化被呈现的方式,证明了社区参与定义有效测量的价值。我们探讨了这些系统化概念如何被操作化为自动化测量工具,可通过多模态 LLM-as-a-judge 方法加以应用,以及仍然存在的挑战。我们反思了此类方法的优势与局限。

关键词

引用

@article{arxiv.2604.02406,
  title  = {Evaluating AI-Generated Images of Cultural Artifacts with Community-Informed Rubrics},
  author = {Nari Johnson and Deepthi Sudharsan and Hamna and Samantha Dalal and Theo Holroyd and Anja Thieme and Hoda Heidari and Daniela Massiceti and Jennifer Wortman Vaughan and Cecily Morrison},
  journal= {arXiv preprint arXiv:2604.02406},
  year   = {2026}
}

备注

Published at ACM FAccT 2026. 15 pages