中文

基于模板的探针是评估 LLM 反事实偏差的不完美透镜

计算与语言 2026-01-15 v5 计算机与社会 机器学习

摘要

大型语言模型(LLM)中的偏差有多种形式,从显性歧视到隐性刻板印象。反事实偏差评估是一种广泛使用的量化偏差的方法,通常依赖于明确声明群体成员身份的基于模板的探针。其旨在衡量 LLM 执行任务的结果是否对群体成员身份的改变保持不变。在本研究中,我们发现基于模板的探针会在偏差测量中引入系统性失真。具体而言,我们一致发现此类探针表明 LLM 将与白人种族相关的文本以不成比例的偏高比率分类为负面。这一现象在大量 LLM、多种多样的基于模板的探针以及不同的分类方法中均被一致观察到。我们假设这是由于 LLM 预训练数据中存在的语言不对称性(以标记性形式,例如 Black president 对比 president)以及用于偏差测量的模板(例如 Black president 对比 White president)而人为产生的。这些发现凸显了反事实偏差评估需要更严谨的方法,以确保观察到的差异反映的是真实偏差,而非语言惯例的伪影。

关键词

引用

@article{arxiv.2404.03471,
  title  = {Template-Based Probes Are Imperfect Lenses for Counterfactual Bias Evaluation in LLMs},
  author = {Farnaz Kohankhaki and D. B. Emerson and Jacob-Junqi Tian and Laleh Seyyed-Kalantari and Faiza Khan Khattak},
  journal= {arXiv preprint arXiv:2404.03471},
  year   = {2026}
}

备注

22 Pages, 6 Figures, 5 Tables