中文

关于 AI 中“厚度评估”文化代表性的论述

计算机与社会 2026-01-21 v2 人工智能 人机交互

摘要

生成式 AI 模型输出的评估正在增加其(不)能否代表非西方文化的能力。我们认为,这些评估往往通过简化的代表理想进行操作,脱离了人们自身对代表性的定义,忽视了文化代表性本质上具有解释性和情境性的特征。与这些“薄”评估相比,我们提出“厚度评估”(thick evaluations)的概念:一种更细致、所处情境且以话语为中心的评估框架,用于评估 AI 输出中社会世界的代表性,深植于社区自身对代表性的理解之中。我们通过孙亚洲的工作坊发展了这一评估框架,研究人们如何解释并赋予意义于 AI 生成的自文化图像。我们提出了更深入的代表性评估实践,拓宽了支撑 AI 评估的代表性理解,并通过与社区共同构建度量标准,将测量实践置于社区一线的实际体验之中。

关键词

引用

@article{arxiv.2503.19075,
  title  = {The Case for "Thick Evaluations" of Cultural Representation in AI},
  author = {Rida Qadri and Mark Diaz and Ding Wang and Michael Madaio},
  journal= {arXiv preprint arXiv:2503.19075},
  year   = {2026}
}

备注

10 pages