中文

词元级熵揭示语言模型中的群体差异

计算与语言 2026-05-08 v3 计算机视觉与模式识别

摘要

我们询问人口统计身份(仅由姓名表示)是否系统地重塑了语言模型的生成分布。通过测量六个开源基础模型和5,760个隐式句子补全提示(例如“Tanisha walked into the office on a Monday morning and”)在零温度下的全词汇香农熵,我们发现,在所有六个架构中,与黑人相关的姓名产生的第一个词元熵高于与白人相关的姓名——这与在显式人口统计提示下记录的输出级同质性偏差(Lee等人,2024)相反——并且与黑人相关的姓名总是比与白人相关的姓名产生更大的高于身份中性基线的熵(所有六个模型中ΔΔ>0)。与女性相关的姓名与较低的第一个词元熵(DL-pooled β̂ = -0.041, p = .019)和更同质的输出(α̂ = +0.024, p < .001)相关,这与同质性偏差的模式一致;种族和性别效应是可加的。指令微调并未减弱种族差距(匹配格式的DL-pooled β̂=+0.153)。使用显式群体标签而非姓名运行相同的模板,在隐式探测显著的12个模型中的10个中产生了无效的种族效应——这表明探测方法是恢复哪种分布结构的主要决定因素。

关键词

引用

@article{arxiv.2501.19337,
  title  = {Token-Level Entropy Reveals Demographic Disparities in Language Models},
  author = {Messi H. J. Lee},
  journal= {arXiv preprint arXiv:2501.19337},
  year   = {2026}
}

备注

9 pages