中文

FairPair:通过配对扰动对语言模型偏差的稳健评估

计算与语言 2024-04-11 v1 计算机与社会 机器学习

摘要

准确评估语言模型对特定群体的差异化对待,对于确保积极且安全的用户体验至关重要。理想的评估应具备稳健性、可扩展至新群体或属性的特性,并且能够捕捉典型使用中出现的偏差(而不仅仅是极端、罕见的情况)。相应地,偏差评估不仅应揭示极其严重的偏差,还应揭示那些微妙且常见的偏差,例如在谈论女性时倾向于讨论外貌。我们提出了 FairPair,一个用于评估日常使用中发生的差异化对待的框架。FairPair 通过反事实对进行操作,但关键是,配对的续写基于相同的人口群体,从而确保了等效比较。此外,与先前的工作不同,我们的方法通过测量采样变异性,考虑了生成过程本身固有的变异性。我们对几个常用的生成模型进行了评估,定性分析表明模型偏好在与女性相关时讨论家庭和爱好。

关键词

引用

@article{arxiv.2404.06619,
  title  = {FairPair: A Robust Evaluation of Biases in Language Models through Paired Perturbations},
  author = {Jane Dwivedi-Yu and Raaz Dwivedi and Timo Schick},
  journal= {arXiv preprint arXiv:2404.06619},
  year   = {2024}
}