“很遗憾听到这个”:利用整体性描述符数据集发现语言模型中的新偏见
计算与语言
2022-10-31 v2 计算机与社会
摘要
随着语言模型日益普及,清晰衡量人口身份的所有可能标记以避免延续现有社会危害变得愈发重要。目前存在许多用于衡量偏见的数据集,但它们在人口轴覆盖上受限,且通常与预设的偏见测试一同使用,这些测试预先假定了模型可能表现出的偏见类型。在本工作中,我们提出一个新的、更具包容性的偏见衡量数据集 HolisticBias,其涵盖 13 个不同人口轴上的近 600 个描述符术语。HolisticBias 以包含具有这些术语切身经历的专家与社区成员的参与式过程汇编而成。这些描述符与一组偏见衡量模板结合,生成超过 450,000 条独特句子提示,我们借此探索、识别并减少若干生成模型中的新型偏见。我们证明 HolisticBias 能有效衡量语言模型词元似然以及冒犯性分类器中此前无法检测的偏见。我们将邀请对该数据集进行补充和修订,希望其能作为评估 NLP 模型中偏见的更易用且标准化方法的基础。
引用
@article{arxiv.2205.09209,
title = {"I'm sorry to hear that": Finding New Biases in Language Models with a Holistic Descriptor Dataset},
author = {Eric Michael Smith and Melissa Hall and Melanie Kambadur and Eleonora Presani and Adina Williams},
journal= {arXiv preprint arXiv:2205.09209},
year = {2022}
}
备注
EMNLP 2022