J1:探索 LLM-as-a-Judge 的简单测试时间扩展
机器学习
2025-05-20 v1 计算与语言
摘要
当前的人工智能研究正从强调模型训练转向增强评估质量,这对于推动人工智能系统的进一步发展至关重要。传统的评估方法通常依赖于对输出分配标量偏好分数的奖励模型。虽然有效,但这种方法缺乏可解释性,使用户常常不确定为何某个奖励模型会将特定响应评分为高或低。LLM-as-a-Judge 的出现提供了更可扩展且更具解释性的监督方式,提供关于决策过程的见解。此外,随着大型推理模型的出现,这些模型会消耗更多的标记用于更深入的思考和答案细化,在 LLM-as-a-Judge 范式中扩展测试时间计算为进一步提升性能并通过推理痕迹提供更多可解释性的途径。本文引入了 ,该模型首先在通过拒绝抽样收集的反思增强数据集上进行监督微调,然后使用可验证奖励进行强化学习训练。在推理时,我们对 J1-7B 应用了简单测试时间扩展 (STTS) 策略以获得额外的性能提升。实验结果表明, 超越了前一代 LLM-as-a-Judge 4.8%,在 STTS 下展现出 5.1% 更强的扩展趋势。此外,我们提出了三个关键发现:(1) 现有的 LLM-as-a-Judge 本身不具备此类扩展趋势。(2) 仅在反思增强数据集上微调的模型仍显示类似的弱扩展行为。(3) 显著的扩展趋势主要在 RL 阶段出现,表明有效的 STTS 能力主要通过 RL 训练获得。
引用
@article{arxiv.2505.11875,
title = {J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge},
author = {Chi-Min Chan and Chunpu Xu and Jiaming Ji and Zhen Ye and Pengcheng Wen and Chunyang Jiang and Yaodong Yang and Wei Xue and Sirui Han and Yike Guo},
journal= {arXiv preprint arXiv:2505.11875},
year = {2025}
}
备注
33 pages, 27 figures