中文

BiasTestGPT:利用 ChatGPT 进行语言模型的社会偏见测试

计算与语言 2023-12-07 v3 计算机与社会

摘要

预训练语言模型(PLMs)带有固有的社会偏见,可能导致有害的现实影响。此类社会偏见通过 PLMs 对出现在测试句子中的不同社会群体与属性所输出的概率值来度量。然而,偏见测试目前颇为繁琐,因为测试句子或由有限的手动模板生成,或需要昂贵的众包。我们转而提出使用 ChatGPT 对任意用户指定的、出现在测试句子中的社会群体与属性组合进行可控的测试句子生成。与基于模板的方法相比,我们使用 ChatGPT 生成测试句子的方法在检测社会偏见方面更优,尤其在交叉偏见等具有挑战性的设定中。我们提出一个开源的综合偏见测试框架(BiasTestGPT),托管于 HuggingFace,可插入任何开源 PLM 进行偏见测试。来自不同领域的领域专家的用户测试表明,他们有兴趣测试现代 AI 的社会偏见。我们的工具显著提升了他们对 PLMs 中此类偏见的认知,被证明可学习且用户友好。因此我们实现了领域专家对 PLMs 的无缝开放式社会偏见测试,通过对任意社会类别与属性组合自动大规模生成多样化测试句子。

关键词

引用

@article{arxiv.2302.07371,
  title  = {BiasTestGPT: Using ChatGPT for Social Bias Testing of Language Models},
  author = {Rafal Kocielnik and Shrimai Prabhumoye and Vivian Zhang and Roy Jiang and R. Michael Alvarez and Anima Anandkumar},
  journal= {arXiv preprint arXiv:2302.07371},
  year   = {2023}
}