中文

追踪预训练 Transformer 中的刻板印象:从有偏神经元到更公平的模型

软件工程 2026-01-12 v1 机器学习

摘要

基于 Transformer 的语言模型的出现重塑了 AI 系统处理和生成文本的方式。在软件工程 (SE) 领域,这些模型现在支持多种活动,加速了自动化和决策制定。然而,有证据表明这些模型可能再现或放大社会偏见,引发了公平性方面的担忧。最近关于神经元编辑的研究表明,预训练 Transformer 中的内部激活可以被追踪和修改,以改变模型行为。基于知识神经元(即编码事实信息的神经元)的概念,我们假设存在有偏神经元,它们捕获了预训练 Transformer 内部的刻板关联。为了验证这一假设,我们构建了一个有偏关系数据集,即编码了九种偏见类型的刻板印象三元组,并调整了神经元归因策略,以追踪和抑制 BERT 模型中的有偏神经元。然后,我们评估了抑制对 SE 任务的影响。我们的发现表明,有偏知识被局部化在小的神经元子集中,抑制它们可以显著减少偏见,同时性能损失极小。这表明 Transformer 中的偏见可以在神经元层面被追踪和缓解,为 SE 中的公平性提供了一种可解释的方法。

关键词

引用

@article{arxiv.2601.05663,
  title  = {Tracing Stereotypes in Pre-trained Transformers: From Biased Neurons to Fairer Models},
  author = {Gianmario Voria and Moses Openja and Foutse Khomh and Gemma Catolino and Fabio Palomba},
  journal= {arXiv preprint arXiv:2601.05663},
  year   = {2026}
}