预算约束下的LLM-as-Judge
机器学习
2026-04-14 v2
摘要
LLM-as-a-judge已成为评估大语言模型的一项关键技术,它利用LLM的推理能力对提示-响应对进行评分。由于LLM的判断具有随机性,从业者通常会对每个对多次查询以准确估计平均分数。这引发了一个关键挑战:在给定固定计算预算的情况下,如何最优地在个提示-响应对之间分配查询,以最小化估计误差?我们提出了一种基于方差自适应的原则性方法,该方法利用了多臂老虎机理论和集中不等式。我们的方法根据估计的分数方差动态分配查询,将资源集中在不确定性最高的地方。此外,我们的算法被证明能够实现最坏情况下的分数估计误差为,其中是对的未知分数方差,且预算分配接近最优。在\emph{Summarize-From-Feedback}和\emph{HelpSteer2}上的实验表明,我们的方法显著优于均匀分配,在保持相同预算的同时减少了最坏情况下的估计误差。我们的工作为高效的LLM评估奠定了理论基础,对AI安全、模型对齐和大规模自动化评估具有实际意义。
引用
@article{arxiv.2602.15481,
title = {LLM-as-Judge on a Budget},
author = {Aadirupa Saha and Aniket Wagde and Branislav Kveton},
journal= {arXiv preprint arXiv:2602.15481},
year = {2026}
}