文本蕴涵并非比Token Probability更好的偏见指标
计算与语言
2026-01-16 v2 计算机与社会
摘要
衡量语言模型中的社会偏见通常采用token probability(TP)指标,这些指标虽具广泛适用性,但因与实际语言模型使用场景和潜在伤害之间的距离较远而受到批评。本文测试了自然语言推理(NLI)作为替代性偏见指标。在七个语言模型家族中进行大量实验后,我们发现NLI与TP偏见评估行为存在显著差异,不同NLI指标之间以及NLI与TP指标之间的相关性极低。NLI指标更脆弱且不稳定,对反刻板词语的敏感性略低于TP方法,而对测试刻板印象词语的敏感性略高于TP方法。基于这些相互冲突的证据,我们结论称,token probability和自然语言推理中并无哪一个是“更好”的偏见指标。我们未找到足够的证据证明NLI可作为TP指标在偏见评估中的完全替代品。
引用
@article{arxiv.2510.07662,
title = {Textual Entailment is not a Better Bias Metric than Token Probability},
author = {Virginia K. Felkner and Allison Lim and Jonathan May},
journal= {arXiv preprint arXiv:2510.07662},
year = {2026}
}
备注
12 pages, 1 figure. Substantial revisions following October 2025 ARR Cycle. Currently under review in January 2026 ARR Cycle