中文

DIF:用于基准测试和验证大语言模型中隐性偏见的框架

计算与语言 2025-12-30 v2

摘要

随着大语言模型(LLMs)在过去几年中日益突出,人们对LLMs从训练数据中继承的潜在偏见感到担忧。先前研究探讨了LLMs如何表现出隐性偏见,例如在引入不同社会语境时响应生成的变化。我们认为,这种隐性偏见不仅是一个伦理问题,也是一个技术问题,因为它揭示了LLMs无法容纳无关信息的能力。然而,与其他LLM智能度量标准不同,目前尚无针对这一特定LLM偏见子集的标准基准方法。为了弥补这一差距,我们开发了一种计算易于解释的基准DIF(Demographic Implicit Fairness,人口统计隐性公平)的方法,通过使用社会人口统计特征画像评估现有的LLM逻辑和数学问题数据集,并结合使用零模型的统计鲁棒性检验。我们证明该方法可以验证LLM行为中隐性偏见的存在,并发现问答准确率与隐性偏见之间存在一种新颖的反向趋势,从而支持我们的论点。

关键词

引用

@article{arxiv.2505.10013,
  title  = {DIF: A Framework for Benchmarking and Verifying Implicit Bias in LLMs},
  author = {Lake Yin and Fan Huang},
  journal= {arXiv preprint arXiv:2505.10013},
  year   = {2025}
}

备注

10 pages, 1 figure