跟上语言模型的步伐:用于偏见审计的系统性基准扩展
计算与语言
2024-09-26 v2
摘要
随着语言模型(LMs)的普及,对其偏见审计已受到相当关注。为此,已提出若干偏见审计基准。同时,LM 的快速演进可能使这些基准很快过时。LM 的脆弱性使偏见审计进一步复杂化:当观察到 presumably 有偏的输出时,是由于模型偏见还是模型脆弱性?我们提议借助模型自身来帮助构建保持挑战性的偏见审计数据集,并引入区分不同类型模型错误的偏见度量。首先,我们结合 LM 生成的词汇变体、对抗过滤和人工验证,扩展现有的 NLI 偏见基准(BBNLI)。我们证明新创建的数据集 BBNLI-next 比 BBNLI 更具挑战性:平均而言,BBNLI-next 将最先进 NLI 模型的准确率从 BBNLI 观测到的 95.3% 降至极低的 57.5%。其次,我们采用 BBNLI-next 展示鲁棒性与偏见之间的相互作用:指出当前偏见分数的缺陷,并提出考虑偏见与模型脆弱性的偏见度量。第三,尽管 BBNLI-next 设计之初面向非生成模型,我们展示新数据集也能揭示最先进开源生成式 LM 中的偏见。注:本工作所含所有数据集均为英文,且针对以美国为中心的社会偏见。本着高效 NLP 研究的精神,本研究未进行任何模型训练或微调。警告:本文包含攻击性文本示例。
引用
@article{arxiv.2305.12620,
title = {Keeping Up with the Language Models: Systematic Benchmark Extension for Bias Auditing},
author = {Ioana Baldini and Chhavi Yadav and Manish Nagireddy and Payel Das and Kush R. Varshney},
journal= {arXiv preprint arXiv:2305.12620},
year = {2024}
}