中文

事实与公平的边界:通过认知偏见重新定义 AI 偏差评估

计算与语言 2025-10-01 v3

摘要

近期事件表明,Google Gemini 生成的持纳纳粹时期制服的人种裕产者,说明 AI 输出虽在事实上合理却在社会上有害。AI 模型越来越受到"公平"评估,但现有基准常常混合两个根本不同的维度:事实正确性和规范公平性。模型可能生成在事实上准确但社会上不公平的回应,反之亦然。我们认为,识别事实与公平之间的边界对于有意义的公平评估至关重要。我们引入 Fact-or-Fair,一个包含 (i) 与描述性、事实基于判断相一致的客观查询,以及 (ii) 与规范性、公平性基于判断相一致的主观查询的基准。我们的查询源自 19 项统计数据,基于认知心理学,借鉴代表性偏见、归因偏见和群内外偏见来解释模型为何常常误混事实与公平。十个前沿模型的实验揭示了不同的事实-公平权衡水平。通过重新框架化公平评估,我们提供了新的理论视角和实用基准,以推动负责任的模型评估。我们的测试套件已公开可用。

关键词

引用

@article{arxiv.2502.05849,
  title  = {Where Fact Ends and Fairness Begins: Redefining AI Bias Evaluation through Cognitive Biases},
  author = {Jen-tse Huang and Yuhang Yan and Linqi Liu and Yixin Wan and Wenxuan Wang and Kai-Wei Chang and Michael R. Lyu},
  journal= {arXiv preprint arXiv:2502.05849},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 (Findings)