LLM 中性别偏见的揭示与缓解
计算与语言
2024-02-20 v1
摘要
大语言模型(LLM)可能会生成带有偏见的回复。然而,以往的直接探测技术包含性别提及或预定义的性别刻板印象,这些内容难以全面收集。因此,我们提出了一种基于条件生成的间接探测框架。该方法旨在诱导 LLM 揭示其性别偏见,即使没有明确的性别或刻板印象提及。我们探索了三种不同的策略来揭示 LLM 中的显性和隐性性别偏见。我们的实验表明,所有测试的 LLM 都表现出显性和/或隐性性别偏见,即使输入中不存在性别刻板印象。此外,在大多数情况下,模型规模的增加或模型对齐会放大偏见。进一步地,我们研究了通过超参数调优、指令引导和去偏调优来缓解 LLM 中偏见的三种方法。值得注意的是,即使没有显式的性别或刻板印象,这些方法也被证明是有效的。
引用
@article{arxiv.2402.11190,
title = {Disclosure and Mitigation of Gender Bias in LLMs},
author = {Xiangjue Dong and Yibo Wang and Philip S. Yu and James Caverlee},
journal= {arXiv preprint arXiv:2402.11190},
year = {2024}
}
备注
The first two authors contribute equally