中文

通过模型编辑消除代码大型语言模型中的性别偏见

软件工程 2024-10-11 v1 人工智能 计算与语言

摘要

近年来,随着大型语言模型 (LLM) 技术的成熟以及高质量编程代码数据集的涌现,研究人员对通过自动方式解决程序综合挑战的信心日益增长。然而,由于 LLM 的训练样本往往未经过筛选, LLM 的性能不免与现实场景不符,导致存在社会偏见。为评估和量化代码 LLM 中的性别偏见,我们提出了一个名为 CodeGenBias (代码生成中的性别偏见) 的数据集,并基于相关职业的实际性别分布提出了一个名为 FB-Score (事实偏见得分) 的评估指标。借助 CodeGenBias 和 FB-Score,我们评估和分析了八个主流代码 LLM 的性别偏见。先前的工作表明,表现良好的知识编辑方法在缓解 LLM 中的社会偏见方面具有潜力。因此,我们开发了一种名为 MG-Editing (多粒度模型编辑) 的模型编辑方法,包括定位和编辑阶段。我们的模型编辑方法 MG-Editing 可应用于模型参数的五个不同层次的粒度:全参数层级、层级、模块层级、行层级和神经元层级。广泛的实验结果不仅显示,我们的 MG-Editing 能够在保持代码 LLM 一般代码生成能力的同时有效消除其性别偏见,还展示了其优异的泛化能力。与此同时,实验结果表明,在考虑模型性别偏见和其一般代码生成能力的情况下,MG-Editing 在粒度为行级和神经元级时最为有效。

关键词

引用

@article{arxiv.2410.07820,
  title  = {Mitigating Gender Bias in Code Large Language Models via Model Editing},
  author = {Zhanyue Qin and Haochuan Wang and Zecheng Wang and Deyuan Liu and Cunhang Fan and Zhao Lv and Zhiying Tu and Dianhui Chu and Dianbo Sui},
  journal= {arXiv preprint arXiv:2410.07820},
  year   = {2024}
}