中文

神经元之恶:解释与缓解预训练语言模型中的社会偏见

计算与语言 2024-06-17 v1

摘要

预训练语言模型(PLMs)被认可包含有害信息,如社会偏见,这可能导致负面社会影响或在应用中甚至引发灾难性结果。此前针对此问题的工作主要关注使用探测等黑盒方法来检测和量化PLMs中的社会偏见,通过观察模型输出。因此,此前的去偏方法主要是在新构建的反刻板印象数据集上进行微调或甚至预训练语言模型,这需要高成本。在本工作中,我们通过引入社会偏见神经元(SC)概念来揭示语言模型内部偏见之谜。具体地,我们提出了SC Integrated Gap Gradients(IG2^2),准确定位语言模型中可归因于不良行为(如社会偏见)的单元(即神经元)。通过将不良行为形式化为语言的分布属性,我们采用情感关联提示来诱发与此类情感相关的敏感词(人口统计学)类别。我们的IG2^2因此将不同人口统计学的不均匀分布归因于特定的社会偏见神经元,这些神经元跟踪语言模型单元中不良行为的轨迹以实现可解释性。此外,基于我们的可解释技术,我们进一步提出了SC Bias Neuron Suppression(BNS)来缓解社会偏见。通过研究BERT、RoBERTa及其与去偏见FairBERTa的差异,IG2^2允许我们定位和抑制识别到的神经元,从而进一步缓解不良行为。按照来自StereoSet的先前指标,我们的模型在保持语言建模能力的低成本下实现了更高程度的公平性。

关键词

引用

@article{arxiv.2406.10130,
  title  = {The Devil is in the Neurons: Interpreting and Mitigating Social Biases in Pre-trained Language Models},
  author = {Yan Liu and Yu Liu and Xiaokang Chen and Pin-Yu Chen and Daoguang Zan and Min-Yen Kan and Tsung-Yi Ho},
  journal= {arXiv preprint arXiv:2406.10130},
  year   = {2024}
}