中文

ImplicitBBQ:基于特征的线路基准测试评估大型语言模型中的隐式偏见

计算与语言 2026-04-03 v1 人工智能

摘要

大型语言模型在明确表明身份时抑制有偏见的输出,但在身份不直接表达时可能仍表现出隐式偏见。现有基准测试使用基于姓名的代理人检测隐式偏见,这些代理人与许多社会人口统计量的关联较弱,无法扩展到年龄或社会经济地位等维度。我们引入 ImplicitBBQ,一个 QA 基准测试,通过特征基线线索评估隐式偏见,这些线索在文化上与身份信号相关,跨年龄、性别、地区、宗教、种姓和社会经济地位。评估 11 个模型后,我们发现开放权重模型中模糊情境下的隐式偏见是显式偏见的 6 倍。安全提示和链式思考推理未能显著缩小这一差距;即使是少量样本提示,能将隐式偏见降低 84%,但种姓偏见仍是其他任何维度的 4 倍。这些发现表明,当前的对齐和提示策略仅解决了偏见评估的表面问题,而留下了文化根植的刻板印象关联。我们公开发布代码和数据集,供模型提供者和研究人员基准潜在缓解技术。

关键词

引用

@article{arxiv.2604.01925,
  title  = {ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues},
  author = {Bhaskara Hanuma Vedula and Darshan Anghan and Ishita Goyal and Ponnurangam Kumaraguru and Abhijnan Chakraborty},
  journal= {arXiv preprint arXiv:2604.01925},
  year   = {2026}
}