从机制可解释性视角解构大语言模型中的偏见
计算与语言
2025-06-09 v2 人工智能
摘要
大型语言模型 (LLMs) 已知会表现出社会、人口学和性别偏见,往往是由于其训练数据所致。本文采用机制可解释性方法,分析此类偏见如何在GPT-2和Llama2等模型中的结构表示。我们聚焦人口学和性别偏见,探讨不同指标以识别负责偏差行为的内部边。随后,我们评估了这些组件在数据集和语言变异下的稳定性、局部化和可推广性。通过系统性消除实验,我们证明偏差相关计算高度局部化,往往集中在少数几个层中。此外,所识别的组件会因微调设置而变化,包括与偏见无关的设置。最后,我们表明删除这些组件不仅会减少偏差输出,还会影响其他自然语言处理任务,如命名实体识别和语言可接受性判断,因为这些任务共享重要组件。
引用
@article{arxiv.2506.05166,
title = {Dissecting Bias in LLMs: A Mechanistic Interpretability Perspective},
author = {Bhavik Chandna and Zubair Bashir and Procheta Sen},
journal= {arXiv preprint arXiv:2506.05166},
year = {2025}
}