中文

CALM:用于语言模型偏见综合评估的多任务基准

计算与语言 2024-08-09 v3 人工智能 机器学习

摘要

随着语言模型(LM)日益强大且被广泛使用,对其可能致害的社会人口偏见进行量化十分重要。先前的偏见度量对用于跨社会群体比较性能的模板中的扰动十分敏感,原因在于模板多样性低或数量有限。此外,多数先前工作仅考虑单一 NLP 任务。我们提出语言模型综合评估(CALM),用于对两类具有普遍相关性的社会人口偏见——性别与种族——进行稳健度量。CALM 集成了十六个用于问答、情感分析与自然语言推理的数据集。每个数据集的样例经筛选产生 224 个高多样性(如长度、词汇)模板。我们为七个不同人口群体各组装 50 个高频人名,生成覆盖三项 NLP 任务的 78,400 条提示。我们的实证评估表明,CALM 偏见分数比先前偏见度量对模板扰动(如同义替换)或模板随机子集选择更为稳健且远不敏感。我们将 CALM 应用于 20 个大语言模型,发现对于 2 个语言模型系列,参数更大的模型往往比较小的模型更具偏见。在所考察的 20 个 LLM 中,T0 系列是偏见最少的模型族。代码可见于 https://github.com/vipulgupta1011/CALM。

关键词

引用

@article{arxiv.2308.12539,
  title  = {CALM : A Multi-task Benchmark for Comprehensive Assessment of Language Model Bias},
  author = {Vipul Gupta and Pranav Narayanan Venkit and Hugo Laurençon and Shomir Wilson and Rebecca J. Passonneau},
  journal= {arXiv preprint arXiv:2308.12539},
  year   = {2024}
}