中文

LFTF: 先定位后微调以缓解大语言模型中的性别偏见

计算与语言 2025-05-22 v1 人工智能

摘要

如今,大型语言模型(LLMs)因其强大的性能而受到广泛关注。然而,由于训练过程中不可避免地暴露于社会偏见数据,LLMs倾向于表现出社会偏见,尤其是性别偏见。为更好地探索和量化LLMs中性别偏见的程度,我们提出了一对数据集,分别命名为GenBiasEval和GenHintEval。GenBiasEval负责评估LLMs中性别偏见的程度,并辅以名为AFGB-Score(绝对公平性别偏见分数)的评估指标。同时,GenHintEval用于评估LLMs能否提供与包含性别提示的提示词一致的响应,并辅以名为UB-Score(无偏分数)的评估指标。此外,为了更有效地缓解LLMs中的性别偏见,我们提出了LFTF(先定位后微调)算法。该算法首先使用名为BMI(块缓解重要性分数)的指标,按与性别偏见的相关性降序排列LLM的特定模块。基于此排序,与性别偏见关联最强的模块随后使用精心设计的损失函数进行微调。大量实验表明,我们提出的LFTF算法能够在保持LLMs通用能力的同时显著缓解性别偏见。

关键词

引用

@article{arxiv.2505.15475,
  title  = {LFTF: Locating First and Then Fine-Tuning for Mitigating Gender Bias in Large Language Models},
  author = {Zhanyue Qin and Yue Ding and Deyuan Liu and Qingbin Liu and Junxian Cai and Xi Chen and Zhiying Tu and Dianhui Chu and Cuiyun Gao and Dianbo Sui},
  journal= {arXiv preprint arXiv:2505.15475},
  year   = {2025}
}