置信陷阱:LLM中的性别偏见与预测确定性
计算与语言
2026-01-13 v1 机器学习
摘要
大型语言模型(LLMs)在敏感领域的日益广泛使用,导致人们对其置信得分如何对应于公平性和偏见产生日益关注。本研究检验了LLM预测置信度与人工标注偏见判断之间的对齐情况。研究聚焦于性别偏见,旨在评估基于LLM预测置信度的校准指标是否有效捕捉LLMs中与公平性相关的差异。结果显示,在六个最先进模型中,Gemma-2 根据性别偏见基准显示校准效果最差。本工作的主要贡献是对LLMs置信度校准的公平性评估,为其伦理部署提供指导。此外,我们引入了新的校准指标 Gender-ECE,用于衡量解决任务中性别差异。
关键词
引用
@article{arxiv.2601.07806,
title = {The Confidence Trap: Gender Bias and Predictive Certainty in LLMs},
author = {Ahmed Sabir and Markus Kängsepp and Rajesh Sharma},
journal= {arXiv preprint arXiv:2601.07806},
year = {2026}
}
备注
AAAI 2026 (AISI Track), Oral. Project page: https://bit.ly/4p8OKQD