中文

BiasEdit:通过模型编辑消除偏见刻板印象

计算与语言 2025-03-12 v1 人工智能 计算机与社会 机器学习

摘要

先前研究已确立语言模型表现出刻板印象偏见。现有的消除偏见策略,如使用反事实数据重新训练、表示投影和提示方法,往往难以有效消除偏见或直接改变模型内部的偏见表示。为此,我们提出了 BiasEdit,一种通过轻量级网络充当编辑器来生成参数更新,以消除语言模型中刻板印象偏见的高效模型编辑方法。BiasEdit 采用消除偏见损失,指导编辑器网络对语言模型的部分参数进行局部编辑,以消除偏见,同时通过保留损失在编辑期间保持语言建模能力。实验在 StereoSet 和 Crows-Pairs 上表明,BiasEdit 在消除偏见方面比 tangent debiasing 基线方法在有效性、效率和鲁棒性方面都更优,几乎不会影响语言模型的一般能力。此外,我们进行偏见追踪,以探测 various 模块中的偏见,并探索偏见编辑对语言模型不同组件的影响。

关键词

引用

@article{arxiv.2503.08588,
  title  = {BiasEdit: Debiasing Stereotyped Language Models via Model Editing},
  author = {Xin Xu and Wei Xu and Ningyu Zhang and Julian McAuley},
  journal= {arXiv preprint arXiv:2503.08588},
  year   = {2025}
}

备注

Accepted by TrustNLP @ NAACL 2025