中文

大语言模型中性别偏见的检测、分类与缓解

计算与语言 2025-06-17 v1

摘要

随着大语言模型(LLM)的快速发展,它们已在广泛领域显著提升了效率。然而,近期研究揭示 LLM 经常表现出性别偏见,导致严重的社会影响。因此,检测、分类和缓解 LLM 中的性别偏见已成为关键研究焦点。在 NLPCC 2025 共享任务 7:中文性别偏见检测、分类与缓解挑战赛中,我们研究了如何提升 LLM 在性别偏见检测、分类和缓解方面的能力。我们采用强化学习、思维链推理和监督微调来处理不同的子任务。具体而言,对于子任务 1 和 2,我们利用 LLM 的内部推理能力以分阶段方式引导多步思考,从而简化复杂的偏见查询并提升响应准确性。对于子任务 3,我们采用基于强化学习的方法,使用 GPT-4 标注偏好数据集。然后我们应用直接偏好优化(DPO),通过引入一个明确偏向较少偏见完成结果而非偏见完成结果的损失函数来缓解性别偏见。我们的方法在 NLPCC 2025 共享任务 7 的所有三个子任务中均排名第一。

关键词

引用

@article{arxiv.2506.12527,
  title  = {Detection, Classification, and Mitigation of Gender Bias in Large Language Models},
  author = {Xiaoqing Cheng and Hongying Zan and Lulu Kong and Jinwang Song and Min Peng},
  journal= {arXiv preprint arXiv:2506.12527},
  year   = {2025}
}