分析 LLM-as-a-Judge 的不确定性:基于保形预测的区间评估
计算与语言
2025-09-24 v1
摘要
LLM-as-a-judge 已成为利用大语言模型(LLM)评估自然语言生成(NLG)的一种极具前景的范式,但其评估的不确定性仍有待深入探索。这种可靠性的缺失可能限制其在众多应用中的部署。本工作提出了首个通过保形预测提供基于 LLM 评分的预测区间来分析不确定性的框架。保形预测从单次评估运行中构建连续的预测区间,我们针对离散评分任务设计了序数边界调整。我们还建议将区间内的中点分数作为原始模型分数和加权平均值的低偏差替代方案。我们进行了广泛的实验和分析,表明保形预测能够提供具有覆盖保证的有效预测区间。我们还探讨了区间中点和重新提示评判对于优化判断的有用性。
引用
@article{arxiv.2509.18658,
title = {Analyzing Uncertainty of LLM-as-a-Judge: Interval Evaluations with Conformal Prediction},
author = {Huanxin Sheng and Xinyi Liu and Hangfeng He and Jieyu Zhao and Jian Kang},
journal= {arXiv preprint arXiv:2509.18658},
year = {2025}
}
备注
To appear in EMNLP 2025. Our code and data are available at \url{https://github.com/BruceSheng1202/Analyzing_Uncertainty_of_LLM-as-a-Judge