中文

从机制可解释性视角解构大语言模型中的偏见

计算与语言 2025-06-09 v2 人工智能

摘要

大型语言模型 (LLMs) 已知会表现出社会、人口学和性别偏见,往往是由于其训练数据所致。本文采用机制可解释性方法,分析此类偏见如何在GPT-2和Llama2等模型中的结构表示。我们聚焦人口学和性别偏见,探讨不同指标以识别负责偏差行为的内部边。随后,我们评估了这些组件在数据集和语言变异下的稳定性、局部化和可推广性。通过系统性消除实验,我们证明偏差相关计算高度局部化,往往集中在少数几个层中。此外,所识别的组件会因微调设置而变化,包括与偏见无关的设置。最后,我们表明删除这些组件不仅会减少偏差输出,还会影响其他自然语言处理任务,如命名实体识别和语言可接受性判断,因为这些任务共享重要组件。

关键词

引用

@article{arxiv.2506.05166,
  title  = {Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective},
  author = {Bhavik Chandna and Zubair Bashir and Procheta Sen},
  journal= {arXiv preprint arXiv:2506.05166},
  year   = {2025}
}