中文

正确报告 LLM 作为评判者的评估

机器学习 2026-02-10 v3 计算与语言 应用统计 机器学习

摘要

大型语言模型(LLM)广泛用作模型响应评估器,以取代人类标注员。然而,LLM评判的灵敏度和特异性不完美,会导致naive评估得分产生偏差。我们提出了一个简单可插入的框架,用于纠正这种偏差,并实现统计上原则的不确定性量化。我们的框架构建置信区间,考虑来自测试数据集和人类标注校准数据集的不确定性。此外,它使用自适应策略分配校准样本,以获得更紧凑的区间。重要的是,我们刻画了由真实评估得分和LLM评判灵敏度和特异性定义的参数 regime,在这些参数下,基于LLM的评估比仅用人类评估更可靠。此外,我们展示了我们的框架在测试数据集和校准数据集之间发生分布迁移时仍然保持无偏,与现有方法不同。

关键词

引用

@article{arxiv.2511.21140,
  title  = {How to Correctly Report LLM-as-a-Judge Evaluations},
  author = {Chungpa Lee and Thomas Zeng and Jongwon Jeong and Jy-yong Sohn and Kangwook Lee},
  journal= {arXiv preprint arXiv:2511.21140},
  year   = {2026}
}

备注

Refined the writing of the manuscript