LLM-as-a-Judge 中的过度自信:诊断与置信驱动的解决方案
人工智能
2025-08-19 v3
摘要
大型语言模型(LLM)广泛用作自动裁判,实际价值取决于准确性和可信赖的、风险感知的判断。现有方法主要关注准确性,忽视了对置信度良好校准的必要性,这对自适应和可靠的评估管线至关重要。本文倡导从以准确性为中心的评估转向置信驱动、风险感知的 LLM-as-a-Judge 系统,强调为可信赖和自适应评估所必需的良好校准置信度。我们系统性地识别了当前 LLM-as-a-Judge 中的过度自信现象,即预测置信度显著高于实际正确性,削弱了实际部署中的可靠性。为量化这一现象,我们引入了 TH-Score 指标,用于衡量置信度-准确性的对齐程度。进一步,我们提出了 LLM-as-a-Fuser,一个集成框架,将 LLM 转化为可靠的、风险感知的评估器。大量实验表明,我们的方法显著提高了校准效果,使自适应、置信驱动的评估管线得以实现,相较于现有基线方法,在可靠性和准确性方面均表现出优越性。
引用
@article{arxiv.2508.06225,
title = {Overconfidence in LLM-as-a-Judge: Diagnosis and Confidence-Driven Solution},
author = {Zailong Tian and Zhuoheng Han and Yanzhe Chen and Haozhe Xu and Xi Yang and Richeng Xuan and Houfeng Wang and Lizi Liao},
journal= {arXiv preprint arXiv:2508.06225},
year = {2025}
}