中文

偏见藏在盲区:检测大语言模型未提及的内容

机器学习 2026-03-02 v4 人工智能

摘要

大语言模型(LLMs)常提供看似合理的链式思维(CoT)推理痕迹,但可能隐藏内部偏见。我们称这些为 *未 verbalized 偏见*。通过其声明推理监控模型因此不可靠,现有偏见评估通常需要预定义类别和手工数据集。在本工作中,我们引入一个全自动、黑盒管道,用于检测任务特定的未 verbalized 偏见。给定任务数据集,管道使用 LLM 评估器生成候选偏见概念。随后,对每个概念在逐步扩大的输入样本上进行测试,通过生成正负变体,并应用用于多重检验和提前停止的统计技术。若概念在模型 CoT 中未被引用为依据,同时产生统计显著的性能差异,则将其标记为未 verbalized 偏见。我们在三个决策任务(招聘、贷款批准和大学录取)上对七个 LLM 进行评估。我们的技术自动发现了这些模型中先前未知的偏见(例如西班牙语流利度、英语水平、写作正式程度),同时该管道在同一运行中也验证了先前工作中手动识别的偏见(性别、种族、宗教、族裔)。更广泛地说,我们提出的方法为自动发现任务特定偏见提供了实用、可扩展的路径。

关键词

引用

@article{arxiv.2602.10117,
  title  = {Biases in the Blind Spot: Detecting What LLMs Fail to Mention},
  author = {Iván Arcuschin and David Chanin and Adrià Garriga-Alonso and Oana-Maria Camburu},
  journal= {arXiv preprint arXiv:2602.10117},
  year   = {2026}
}

备注

11 pages