中文

KnowBias:通过 Know-Bias 神经元增强缓解 LLM 中的社会偏见

人工智能 2026-01-30 v1

摘要

大型语言模型(LLMs) exhibit social biases that reinforce harmful stereotypes, limiting their safe deployment. 现有大多数去偏方法采用抑制性范式,通过修改与偏差行为相关的参数、提示或神经元来实现,但此类方法常常脆弱、泛化较弱、数据效率低,且容易降低通用能力。我们提出 KnowBias 框架,这是一个轻量且概念上独特的方法,通过强化而非抑制编码偏差知识的神经元来缓解偏见。KnowBias 通过基于归因分析的方法识别编码偏差知识的神经元,并在推理时选择性地增强这些神经元。该设计实现了强大的去偏效果,同时保持通用能力,能够跨越不同偏差类型和人口统计学特征进行泛化,且数据效率极高,只需少量简单 yes/no 问题即可实现,无需重新训练。在多个基准测试和 LLMs 上进行的实验表明,KnowBias 在保持最小化实用性损失的同时,持续实现最先进的去偏性能。数据和代码已公开于 https://github.com/JP-25/KnowBias。

关键词

引用

@article{arxiv.2601.21864,
  title  = {KnowBias: Mitigating Social Bias in LLMs via Know-Bias Neuron Enhancement},
  author = {Jinhao Pan and Chahat Raj and Anjishnu Mukherjee and Sina Mansouri and Bowen Wei and Shloka Yada and Ziwei Zhu},
  journal= {arXiv preprint arXiv:2601.21864},
  year   = {2026}
}