我们能否定位并阻止 LLM 中的刻板印象?
计算与语言
2026-04-23 v1 人工智能
摘要
大型语言模型(LLM)中的刻板印象可能会延续有害的社会偏见。尽管这些模型被广泛使用,但人们对这些偏见在神经网络中的具体位置知之甚少。本研究调查了 GPT 2 Small 和 Llama 3.2 的内部机制,以定位与刻板印象相关的激活。我们探索了两种方法:识别编码刻板印象的个体对比神经元激活,以及检测对偏见输出贡献较大的注意力头。我们的实验旨在绘制这些“偏见指纹”,并为缓解刻板印象提供初步见解。
引用
@article{arxiv.2604.19764,
title = {Can We Locate and Prevent Stereotypes in LLMs?},
author = {Alex D'Souza},
journal= {arXiv preprint arXiv:2604.19764},
year = {2026}
}