CyclicJudge:高效缓解 LLM 评估中判官偏差的方法
计算与语言
2026-05-05 v3
摘要
LLM 作为判官的评估已成为开放式模型评估的标准实践;然而,判官存在系统性偏差,无法通过增加情景数量或生成次数来消除。这些偏差的Magnitude往往与基准测试旨在检测的模型差异相当,导致单次判官评估时排名不可靠。我们提出一种方差分解,将基准得分的方差分为情景、生成、判官和残差四个组成部分。基于此分析,我们展示CyclicJudge——一种针对固定判官团队和判官调用预算的最优策略——在实际操作中表现为将判官分配到各个情景的轮流模式:在保持单次判官评估成本不变的前提下,得分能够精确恢复判官团队的平均值。在MT-Bench和MindEval上的实验结果验证了CyclicJudge的有效性,适用于通用场景和特定领域的评估设置。
引用
@article{arxiv.2603.01865,
title = {CyclicJudge: Mitigating Judge Bias Efficiently in LLM-based Evaluation},
author = {Ziyi Zhu and Olivier Tieleman and Alexey Bukhtiyarov and Jinghong Chen},
journal= {arXiv preprint arXiv:2603.01865},
year = {2026}
}