MCTS-Judge:LLM-as-a-Judge 在代码正确性评估中的测试时扩展
机器学习
2026-05-28 v2 人工智能
摘要
LLM-as-a-Judge 范式在评估生成内容方面显示出前景,但在推理密集型情境(如编程)中缺乏可靠性。受近期推理模型进展和规模化法则转变的启发,我们首次将测试时计算引入 LLM-as-a-Judge,提出 MCTS-Judge,这是一种资源高效的、面向 System-2 思维框架的代码正确性评估方法。MCTS-Judge 利用蒙特卡洛树搜索(MCTS)将问题分解为更简单的、多视角评估。通过结合基于当前轨迹中历史动作的自评估和基于先前 rollout 的上置信度树(UCB)节点选择策略,MCTS-Judge 在全局优化与完善当前轨迹之间取得平衡。我们进一步设计了高精度、单元测试级别的奖励机制,以鼓励大语言模型(LLM)进行逐行分析。广泛的实验在三个基准测试和五个 LLM 上表明,MCTS-Judge 的有效性,使基础模型准确率从 41% 提升至 80%,在 token 使用量为原型系列模型的 3 倍时便超越了 o1 系列模型。进一步的评估验证了其在逻辑、分析、全面性和整体质量方面的推理轨迹优势,同时揭示了 LLM-as-a-Judge 范式的测试时规模化法则。
引用
@article{arxiv.2502.12468,
title = {MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation},
author = {Yutong Wang and Pengliang Ji and Chaoqun Yang and Kaixin Li and Ming Hu and Jiaoyang Li and Guillaume Sartoretti},
journal= {arXiv preprint arXiv:2502.12468},
year = {2026}
}