关于 AI 中“厚度评估”文化代表性的论述
计算机与社会
2026-01-21 v2 人工智能
人机交互
摘要
生成式 AI 模型输出的评估正在增加其(不)能否代表非西方文化的能力。我们认为,这些评估往往通过简化的代表理想进行操作,脱离了人们自身对代表性的定义,忽视了文化代表性本质上具有解释性和情境性的特征。与这些“薄”评估相比,我们提出“厚度评估”(thick evaluations)的概念:一种更细致、所处情境且以话语为中心的评估框架,用于评估 AI 输出中社会世界的代表性,深植于社区自身对代表性的理解之中。我们通过孙亚洲的工作坊发展了这一评估框架,研究人们如何解释并赋予意义于 AI 生成的自文化图像。我们提出了更深入的代表性评估实践,拓宽了支撑 AI 评估的代表性理解,并通过与社区共同构建度量标准,将测量实践置于社区一线的实际体验之中。
引用
@article{arxiv.2503.19075,
title = {The Case for "Thick Evaluations" of Cultural Representation in AI},
author = {Rida Qadri and Mark Diaz and Ding Wang and Michael Madaio},
journal= {arXiv preprint arXiv:2503.19075},
year = {2026}
}
备注
10 pages