中文

通过遮蔽不公平驱动注意力头来消除大语言模型中的偏见

计算与语言 2025-11-04 v3 人工智能

摘要

大语言模型 (LLM) 越来越多地介于不容许对人口统计学群体产生不公平对待的领域中。现有研究探讨偏见输出出现的时机,但对生成这些输出的机制几乎没有提供见解,导致现有缓解措施大多不稳健。本文进行了系统性的 LLM 不公平性调查,提出了DiffHeads,一种用于 LLM 的轻量级消除偏见框架。我们首先将直接回答 (DA) 提示与链式思维 (CoT) 提示在八个代表性的开源和闭源 LLM 之间进行比较。DA 会触发 LLM 的天然偏见部分,在一次轮和两轮对话中将不公平性提高 534.5% 至 391.9%。接下来,我们定义了一种标记到注意力头的贡献得分,用于追踪每个标记对单个注意力头的影响。这揭示了一小簇 bias heads 在 DA 激活,但在 CoT 中几乎不活跃,这是首次在提示策略和偏见出现之间建立因果联系。最后,基于这一洞见,我们提出了DiffHeads,通过在 DA 和 CoT 之间的差分激活分析识别 bias heads,并有选择性地屏蔽这些 heads。DiffHeads 在 DA 和 CoT 情况下分别将不公平性降低 49.4% 和 40.3%,而不会损害模型实用性。

关键词

引用

@article{arxiv.2510.10142,
  title  = {Debiasing LLMs by Masking Unfairness-Driving Attention Heads},
  author = {Tingxu Han and Wei Song and Ziqi Ding and Ziming Li and Chunrong Fang and Yuekang Li and Dongfang Liu and Zhenyu Chen and Zhenting Wang},
  journal= {arXiv preprint arXiv:2510.10142},
  year   = {2025}
}