中文

评估法官作为评估者:JETTS LLM-评判基准测试作为测试时间扩展评估者

计算与语言 2025-05-23 v2 机器学习

摘要

扩大测试时间计算,或为大型语言模型 (LLM) 在推理期间提供额外计算资源,通常依赖于外部非生成式评估者(即奖励模型)。同时,LLM-评判模型正在受到日益增长的关注,这类模型被训练用于以自然语言生成评估和批判(解释)。尽管评判模型在实证层面上取得了成功,但其在测试时间扩展设置下的有效性仍知之甚少。本文引入 Judge Evaluation for Test-Time Scaling (JETTS) 基准测试,评估评判模型在三个领域(数学推理、代码生成和指令遵循)中的表现,分别置于三个任务设置下:响应重排序、分级束搜索和基于批判的响应优化。我们评估了 10 个不同规模的评判模型(7B-70B 参数)以及 8 个不同的基础生成模型(6.7B-72B 参数)。我们的基准显示,尽管评判模型在重排序方面与结果奖励模型相当,但在束搜索程序中始终不如过程奖励模型。此外,独异于 LLM-评判的是,其自然语言批判目前在引导生成器朝更好响应方面效果有限。

关键词

引用

@article{arxiv.2504.15253,
  title  = {Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators},
  author = {Yilun Zhou and Austin Xu and Peifeng Wang and Caiming Xiong and Shafiq Joty},
  journal= {arXiv preprint arXiv:2504.15253},
  year   = {2025}
}

备注

ICML 2025. The first two authors contributed equally. The codebase is at https://github.com/SalesforceAIResearch/jetts-benchmark