中文

预算约束下的LLM-as-Judge

机器学习 2026-04-14 v2

摘要

LLM-as-a-judge已成为评估大语言模型的一项关键技术,它利用LLM的推理能力对提示-响应对进行评分。由于LLM的判断具有随机性,从业者通常会对每个对多次查询以准确估计平均分数。这引发了一个关键挑战:在给定固定计算预算BB的情况下,如何最优地在KK个提示-响应对之间分配查询,以最小化估计误差?我们提出了一种基于方差自适应的原则性方法,该方法利用了多臂老虎机理论和集中不等式。我们的方法根据估计的分数方差动态分配查询,将资源集中在不确定性最高的地方。此外,我们的算法被证明能够实现最坏情况下的分数估计误差为O~(i=1Kσi2B)\tilde{O}\left(\sqrt{\frac{\sum_{i=1}^K \sigma_i^2}{B}}\right),其中σi2\sigma_i^2是对i[K]i \in [K]的未知分数方差,且预算分配接近最优。在\emph{Summarize-From-Feedback}和\emph{HelpSteer2}上的实验表明,我们的方法显著优于均匀分配,在保持相同预算的同时减少了最坏情况下的估计误差。我们的工作为高效的LLM评估奠定了理论基础,对AI安全、模型对齐和大规模自动化评估具有实际意义。

关键词

引用

@article{arxiv.2602.15481,
  title  = {LLM-as-Judge on a Budget},
  author = {Aadirupa Saha and Aniket Wagde and Branislav Kveton},
  journal= {arXiv preprint arXiv:2602.15481},
  year   = {2026}
}