因果评判评估:LLM系统的校准替代指标
统计方法学
2026-01-22 v3 应用统计
机器学习
摘要
测量长期 LLM 结果(用户满意度、专家判断、下游 KPI)成本高昂。团队默认使用低成本的 LLM 评判器,但未校准的代理指标可能完全颠倒排名。因果评判评估 (CJE) 使以可负担的成本瞄准正确目标成为可能:针对小规模预言机切片校准低成本分数,然后以有效的置信度进行大规模评估。我们将替代有效性视为可审计的:对于每个策略或部署上下文,小规模预言机审计会测试学习到的校准是否保持均值无偏,从而将不可检验的识别条件转化为可证伪的诊断。在比较五种策略的 4,961 个 Chatbot Arena 提示词上,在 16 倍的预言机/评判器成本比下,以 5% 的预言机比例,CJE 以低 14 倍的成本实现了 99% 的成对排名准确率;在所有配置(5-50% 预言机,变化的 n)中,准确率平均为 94%。一个对抗性策略未能通过迁移审计并被正确标记;在这种情况下,CJE 拒绝水平声明,而不是报告有偏估计。主要发现:原始评判器分数上的朴素置信区间实现了 0% 的覆盖率(CJE:约 95%);尽管有效样本量 >90%,重要性加权估计器仍然失败;覆盖率受限效率 (CLE) 界限及其 TTC 诊断解释了原因。
引用
@article{arxiv.2512.11150,
title = {Causal Judge Evaluation: Calibrated Surrogate Metrics for LLM Systems},
author = {Eddie Landesberg and Manjari Narayan},
journal= {arXiv preprint arXiv:2512.11150},
year = {2026}
}
备注
Code: https://github.com/cimo-labs/cje Experiments for Reproducibility: https://github.com/cimo-labs/cje-arena-experiments Original Preprint: https://zenodo.org/records/17903629