中文

定位与缓解大语言模型中的性别偏见

计算与语言 2024-03-22 v1 人工智能

摘要

大语言模型(LLM)通过在广泛语料库上预训练来学习包含人类偏好在内的事实和人类认知。然而,这一过程可能无意中导致这些模型习得社会中普遍存在的偏见和刻板印象。先前的研究通常从单一维度处理偏见问题,要么专注于定位偏见,要么专注于缓解偏见。这种有限的视角为促进偏见研究协同互补和逐步发展造成了障碍。在本研究中,我们将定位和缓解偏见的过程整合到一个统一的框架内。首先,我们使用因果中介分析来追踪大语言模型内不同组件激活的因果效应。在此基础上,我们提出了 LSDM(最小二乘去偏方法),一种基于知识编辑的方法,用于缓解职业代词中的性别偏见,并在三个性别偏见数据集和七个知识能力测试数据集上将其与两个基线方法进行了比较。实验结果表明,性别偏见的主要贡献者是作用于职业代词最后一个 token 的底层 MLP 模块和作用于句子最后一个词的顶层注意力模块。此外,LSDM 比其他基线方法更有效地缓解了模型中的性别偏见,同时完全保留了模型在所有其他方面的能力。

关键词

引用

@article{arxiv.2403.14409,
  title  = {Locating and Mitigating Gender Bias in Large Language Models},
  author = {Yuchen Cai and Ding Cao and Rongxi Guo and Yaqin Wen and Guiquan Liu and Enhong Chen},
  journal= {arXiv preprint arXiv:2403.14409},
  year   = {2024}
}

备注

23 pages, 5 figures