中文

LLM 中性别偏见的揭示与缓解

计算与语言 2024-02-20 v1

摘要

大语言模型(LLM)可能会生成带有偏见的回复。然而,以往的直接探测技术包含性别提及或预定义的性别刻板印象,这些内容难以全面收集。因此,我们提出了一种基于条件生成的间接探测框架。该方法旨在诱导 LLM 揭示其性别偏见,即使没有明确的性别或刻板印象提及。我们探索了三种不同的策略来揭示 LLM 中的显性和隐性性别偏见。我们的实验表明,所有测试的 LLM 都表现出显性和/或隐性性别偏见,即使输入中不存在性别刻板印象。此外,在大多数情况下,模型规模的增加或模型对齐会放大偏见。进一步地,我们研究了通过超参数调优、指令引导和去偏调优来缓解 LLM 中偏见的三种方法。值得注意的是,即使没有显式的性别或刻板印象,这些方法也被证明是有效的。

关键词

引用

@article{arxiv.2402.11190,
  title  = {Disclosure and Mitigation of Gender Bias in LLMs},
  author = {Xiangjue Dong and Yibo Wang and Philip S. Yu and James Caverlee},
  journal= {arXiv preprint arXiv:2402.11190},
  year   = {2024}
}

备注

The first two authors contribute equally