九位法官,仅两票有效:相关错误削弱了LLM评估小组的可靠性
计算与语言
2026-05-29 v1
摘要
LLM评估小组聚合来自多个模型的投票,期望不同模型能提供更可靠的评估。我们构建了衡量此类小组真实信息价值的框架,并量化其可靠性远低于独立投票理想值的程度。在将9个前沿LLM(来自7个模型家族)在三个自然语言推理数据集上进行测试(每个数据集的每个条目都有100个人工标注),我们发现这9个评判器实际上仅提供约2个独立投票的信息量。约四分之三的名义独立性因模型在同一项目上犯错而丢失。其影响显著:小组的实际准确率比独立投票实现的准确率低8-22个百分点,而最佳单一评判器在所有条件下都能与完整小组相当或优于。无论是增加更多评判器还是使用更智能的聚合算法都无济于事——已知方法最多只能缩小这一差距的11%,即便获得正确答案。我们使用Kish有效样本量(n_eff)和Condorcet零模型来量化这些发现,并展示在提示变体、温度、链式思考推理以及配对偏好任务(RewardBench)中,差距均具有鲁健性。瓶颈在于相关评判器,而非聚合算法,这意味着扩大小组规模无法替代真正的独立评估。
引用
@article{arxiv.2605.29800,
title = {Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels},
author = {Guneet Kohli},
journal= {arXiv preprint arXiv:2605.29800},
year = {2026}
}
备注
14 pages, 5 figures, 12 tables