BiasEdit:通过模型编辑消除偏见刻板印象
计算与语言
2025-03-12 v1 人工智能
计算机与社会
机器学习
摘要
先前研究已确立语言模型表现出刻板印象偏见。现有的消除偏见策略,如使用反事实数据重新训练、表示投影和提示方法,往往难以有效消除偏见或直接改变模型内部的偏见表示。为此,我们提出了 BiasEdit,一种通过轻量级网络充当编辑器来生成参数更新,以消除语言模型中刻板印象偏见的高效模型编辑方法。BiasEdit 采用消除偏见损失,指导编辑器网络对语言模型的部分参数进行局部编辑,以消除偏见,同时通过保留损失在编辑期间保持语言建模能力。实验在 StereoSet 和 Crows-Pairs 上表明,BiasEdit 在消除偏见方面比 tangent debiasing 基线方法在有效性、效率和鲁棒性方面都更优,几乎不会影响语言模型的一般能力。此外,我们进行偏见追踪,以探测 various 模块中的偏见,并探索偏见编辑对语言模型不同组件的影响。
引用
@article{arxiv.2503.08588,
title = {BiasEdit: Debiasing Stereotyped Language Models via Model Editing},
author = {Xin Xu and Wei Xu and Ningyu Zhang and Julian McAuley},
journal= {arXiv preprint arXiv:2503.08588},
year = {2025}
}
备注
Accepted by TrustNLP @ NAACL 2025