中文

在同等尺度上比较人类与模型:面向指代消解中的认知性别偏见评估

计算与语言 2025-08-25 v1

摘要

虚假相关性被发现是解释各类 NLP 任务(如性别或种族伪影)中模型性能的重要因素,常被视为实际任务中的“捷径”。然而,人类同样倾向于基于社会和认知预设做出快速(有时错误)的预测。本文探讨一个问题:我们能否量化模型偏见反映人类行为的程度?回答该问题将有助于阐明模型性能,并提供与 humans 的有意义比较。我们通过人类决策的双过程理论视角来探讨此问题。该理论区分自动无意识(有时有偏见)的“快系统”和“慢系统”,后者被触发时可能重新审视先前的自动反应。我们通过两个关于指代消解中性别偏见的众包实验做出若干观察,利用自定步速阅读研究“快系统”,并在受限时间设置下利用问答研究“慢系统”。在真实世界数据上,人类做出比模型多约 3% 的性别偏见决策,而在合成数据上模型偏见约多 12%。

关键词

引用

@article{arxiv.2305.15389,
  title  = {Comparing Humans and Models on a Similar Scale: Towards Cognitive Gender Bias Evaluation in Coreference Resolution},
  author = {Gili Lior and Gabriel Stanovsky},
  journal= {arXiv preprint arXiv:2305.15389},
  year   = {2025}
}