解构LLM-as-a-Judge:基于贝叶斯线性回归的推理时间扩展可分析模型
机器学习
2026-02-13 v2 人工智能
摘要
最近的大型语言模型发展显示,在训练时间内重新分配显著计算资源到推理时间方面具有优势。然而,推理时间扩展的原理尚不清晰。本文引入一种推理时间扩展的可分析可行模型:基于奖励加权抽样器的贝叶斯线性回归,其中奖励由线性模型决定,建模LLM-as-a-Judge场景。我们在高维 regime 下研究此问题,其中确定性等价指导后验预测均值和方差的闭式表达式。我们分析当训练数据来自教师模型时的情况下的概括误差。我们抽取k次推理时间样本,并通过温度参数应用的softmax进行选择。当奖励与教师不太不同时,概括误差随推理时间样本数k的增加而单调减少。然而,优化推理时间选择的特定奖励通常与教师不同。相比,显著的奖励误指定定会导致存在有限的最优k,超过该值后更多抽样可能增加概括误差。对于固定的k,存在最优抽样温度。我们在大型语言模型推理中通过额外的大型语言模型作为裁判进行实验验证。对于以教师作为奖励的"最佳-k"极限下,我们理论上显示概括误差按衰减,并通过极值理论确定主导系数。这些公式阐明了在哪些情况下扩展推理时间计算在收集更多数据方面具有可证明的优势。最后,我们展示当任务难度增加时,之前提到的推理时间计算优势会逐渐减弱。
引用
@article{arxiv.2512.19905,
title = {Demystifying LLM-as-a-Judge: Analytically Tractable Model for Inference-Time Scaling},
author = {Indranil Halder and Cengiz Pehlevan},
journal= {arXiv preprint arXiv:2512.19905},
year = {2026}
}
备注
27 pages