中文

评估 LLM 在道德判断中的性别偏见

计算与语言 2024-10-15 v1

摘要

大型语言模型(LLM)在诸多自然语言处理(NLP)任务中展现出惊人的能力。然而,这些模型仍然免不具备社交偏见,如性别偏见等局限性。本工作调查当前封闭式和开源 LLM 是否在给出道德意见时存在性别偏见。为评估这些模型,我们构建并引入了一个新数据集 GenMO(道德意见中的性别偏见),包含以男性和女性角色分别呈现的平行短篇故事。具体而言,我们测试了来自 GPT 系列模型(GPT-3.5-turbo、GPT-3.5-turbo-instruct、GPT-4-turbo)、Llama 3 和 3.1 系列(8B/70B)、Mistral-7B 以及 Claude 3 系列(Sonnet 和 Opus)的模型。令人意外的是,尽管采用了安全措施,我们测试的所有生产级模型都显示出显著的性别偏见,其中 GPT-3.5-turbo 在 24% 的样本中给出偏见意见。此外,所有模型都一致偏好女性角色,其中 GPT 在 68-85% 的案例中显示偏见,Llama 3 在约 81-85% 的实例中显示偏见。我们还研究了模型参数对性别偏见的影响,并探讨了 LLM 在道德决策中揭示偏见的实际情境。

关键词

引用

@article{arxiv.2410.09992,
  title  = {Evaluating Gender Bias of LLMs in Making Morality Judgements},
  author = {Divij Bajaj and Yuanyuan Lei and Jonathan Tong and Ruihong Huang},
  journal= {arXiv preprint arXiv:2410.09992},
  year   = {2024}
}

备注

Accepted by EMNLP Findings 2024