检验推理型 LLM 作为评判者在不可验证的 LLM 后训练中的表现
人工智能
2026-03-13 v1 计算与语言
机器学习
摘要
推理型 LLM 作为评判者,可以从推理时扩展中受益,为将推理模型的成功扩展到无法直接检查输出正确性/质量的不可验证领域提供了一条有前景的途径。然而,虽然推理评判者在静态评估基准上表现出更好的性能,但它们在实际策略训练中的有效性尚未得到系统性的检验。因此,我们进行了一项严谨的研究,以调查非推理型和推理型评判者在基于强化学习的 LLM 对齐中的实际影响。我们的受控合成设置中,“黄金标准”评判者(gpt-oss-120b)提供偏好标注来训练较小的评判者,揭示了非推理型和推理型评判者之间的关键差异:非推理型评判者容易导致奖励黑客攻击,而推理型评判者可以导致策略在黄金标准评判者评估时取得强劲性能。有趣的是,我们发现,推理评判者训练的策略通过学会生成高度有效的对抗性输出来取得如此强劲的性能,这些输出还可以通过欺骗其他 LLM 评判者在 Arena-Hard 等流行基准上取得高分。结合我们的进一步分析,我们的研究强调了在不可验证的 LLM 后训练中应用(推理型)LLM 评判者的重要发现和改进空间。
引用
@article{arxiv.2603.12246,
title = {Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training},
author = {Yixin Liu and Yue Yu and DiJia Su and Sid Wang and Xuewei Wang and Song Jiang and Bo Liu and Arman Cohan and Yuandong Tian and Zhengxing Chen},
journal= {arXiv preprint arXiv:2603.12246},
year = {2026}
}