中文

面向不完美评判者的 LLM 稳健统计评估

机器学习 2026-01-30 v1 人工智能 计算机视觉与模式识别

摘要

可靠地认证大型语言模型(LLM)——即证明其故障率低于安全阈值——至关重要 yet 充满挑战。虽然“LLM 作为评判者”(LLM-as-a-Judge)提供了可扩展性,但评判者的不完美、噪声和偏差可能使统计保证失效。我们引入“不完美但有效”(Noisy but Valid)假设检验框架以应对此问题。通过利用小规模的人类标注校准集估计评判者的真阳性率和假阳性率(TPR/FPR),我们推导出应用于大规模评判者标注数据集的方差校正临界阈值。关键在于,我们的框架在校准不确定性下仍理论上保证有限样本 Type-I 错误控制(有效性),这将我们的工作与预测驱动推断(PPI)区分开来,将我们的方法定位为一种显式建模评判者行为的诊断工具,而非黑箱估计器。我们的贡献包括:(1)理论保证:我们推导了噪声检验在统计功效上高于直接评估的确切条件;(2)实证验证:Jigsaw Comment、Hate Speech 和 SafeRLHF 上的实验确认了我们的理论;(3)Oracle 差距:我们揭示了实际方法与理论上“Oracle”(完美已知评判者参数)之间存在显著的性能差距,量化了估计成本。具体而言,我们提供了对不完美评判者情境的首个系统性处理,产生可解释的评判者可靠性诊断,并阐明评估功效如何取决于评判者质量、数据集规模和认证水平。综上,这些结果加深了对 LLM 评判者统计评估的理解,突显了各种推断工具之间的权衡。

关键词

引用

@article{arxiv.2601.20913,
  title  = {Noisy but Valid: Robust Statistical Evaluation of LLMs with Imperfect Judges},
  author = {Chen Feng and Minghe Shen and Ananth Balashankar and Carsten Gerner-Beuerle and Miguel R. D. Rodrigues},
  journal= {arXiv preprint arXiv:2601.20913},
  year   = {2026}
}

备注

Accepted to ICLR2026