中文

置信陷阱:LLM中的性别偏见与预测确定性

计算与语言 2026-01-13 v1 机器学习

摘要

大型语言模型(LLMs)在敏感领域的日益广泛使用,导致人们对其置信得分如何对应于公平性和偏见产生日益关注。本研究检验了LLM预测置信度与人工标注偏见判断之间的对齐情况。研究聚焦于性别偏见,旨在评估基于LLM预测置信度的校准指标是否有效捕捉LLMs中与公平性相关的差异。结果显示,在六个最先进模型中,Gemma-2 根据性别偏见基准显示校准效果最差。本工作的主要贡献是对LLMs置信度校准的公平性评估,为其伦理部署提供指导。此外,我们引入了新的校准指标 Gender-ECE,用于衡量解决任务中性别差异。

关键词

引用

@article{arxiv.2601.07806,
  title  = {The Confidence Trap: Gender Bias and Predictive Certainty in LLMs},
  author = {Ahmed Sabir and Markus Kängsepp and Rajesh Sharma},
  journal= {arXiv preprint arXiv:2601.07806},
  year   = {2026}
}

备注

AAAI 2026 (AISI Track), Oral. Project page: https://bit.ly/4p8OKQD