中文

种族、民族及其对大语言模型偏见的影响

计算与语言 2026-01-21 v1 机器学习

摘要

大语言模型(LLM)日益应用于医疗保健与医学等高风险场景,其中种族与民族等人口统计学属性可能被明确陈述或从文本中隐式推断。然而,现有研究主要记录了结果层面的差异,对这些效应背后的内部机制提供的洞察有限。我们提出了一项关于种族与民族在 LLM 中如何表示与运作的机制研究。利用涵盖毒性相关生成和临床叙事理解任务的两个公开数据集,我们通过结合探测、神经元级归因和针对性干预的可复现可解释性流水线,分析了三个开源模型。我们发现,人口统计学信息分布于内部单元中,且存在显著的跨模型差异。尽管某些单元从预训练中编码了敏感或刻板印象相关的关联,但相同的人口统计学线索可以引发定性上不同的行为。抑制此类神经元的干预减少了偏见,但仍留下大量残余效应,表明这是行为上的改变而非表征上的改变,这促使需要更系统的缓解措施。

关键词

引用

@article{arxiv.2601.12868,
  title  = {Race, Ethnicity and Their Implication on Bias in Large Language Models},
  author = {Shiyue Hu and Ruizhe Li and Yanjun Gao},
  journal= {arXiv preprint arXiv:2601.12868},
  year   = {2026}
}

备注

Work in process