中文

评估 LLM 在知名人物中的性别差异

计算与语言 2024-03-15 v1 信息检索

摘要

本研究考察了大型语言模型 (LLM) 在检索事实信息方面的应用,探讨了对其产生事实上不正确的“幻觉”响应或完全拒绝回答提示的倾向的担忧。具体而言,它调查了 LLM 对事实查询的响应中是否存在基于性别的偏见。本文采用多管齐下的方法,通过评估召回率、幻觉和拒绝回答等多个维度的公平性来评估 GPT 模型。我们的发现揭示了 GPT-3.5 生成的响应中存在明显的性别差异。尽管 GPT-4 的进步带来了性能上的提升,但并未完全消除这些性别差异,特别是在拒绝回答的情况下。研究通过考察提示中性别关联的影响以及响应的同质性,进一步探讨了这些差异的起源。

关键词

引用

@article{arxiv.2403.09148,
  title  = {Evaluating LLMs for Gender Disparities in Notable Persons},
  author = {Lauren Rhue and Sofie Goethals and Arun Sundararajan},
  journal= {arXiv preprint arXiv:2403.09148},
  year   = {2024}
}