中文

通过培育探索性思维来缓解 LLM 中的性别偏见

计算与语言 2026-01-15 v3 人工智能 计算机与社会

摘要

大型语言模型 (LLM) 常常表现出性别偏见,导致在不同情境下对男性和女性主体的对待不平等。为此,我们提出一种新型数据生成框架,通过培育 LLM 的探索性思维来缓解此问题。我们的做法是让模型生成由男性和女性主角构成的情节对,这些情节在结构上相同且在道德上含糊,然后引导模型对其道德判断进行评估并进行比较。当出现不一致时,模型会被指引产生平衡且性别中性的判断。这些情节-判断对用于通过直接偏好优化 (Direct Preference Optimization, DPO) 对模型进行微调或优化。实验结果表明,我们的方法显著降低了性别偏见,同时保持甚至提升了模型的一般能力。我们将发布代码和生成的数据。我们将在 https://github.com/WeiKangda/LLMs-Exploratory-Bias-Mitigation/tree/main 上发布代码和生成的数据。

关键词

引用

@article{arxiv.2505.17217,
  title  = {Mitigating Gender Bias via Fostering Exploratory Thinking in LLMs},
  author = {Kangda Wei and Hasnat Md Abdullah and Ruihong Huang},
  journal= {arXiv preprint arXiv:2505.17217},
  year   = {2026}
}