J1:通过强化学习激励 LLM-as-a-Judge 进行思考
计算与语言
2025-10-14 v3 人工智能
机器学习
摘要
AI 进步受限于评估质量, 强大的 LLM-as-a-Judge 模型成为核心解决方案. 这些评判员的效能取决于其链式思考推理, 因此迫切需要能够有效优化这一推理过程的方法. 本文介绍了 J1, 一个用于教导 LLM 评判员在做出决定前进行思考的强化学习框架. 我们的核心贡献在于将非可验证和可验证提示的所有评判任务转换为具有可验证奖励的统一格式, 从而在缓解位置偏差的同时, 直接优化评估质量. 我们随后使用 RL 在 8B、32B 和 70B 规模的模型上进行训练, 并在多个基准测试中展示它们取得了最新性能. 特别是, 我们多任务点评和配对评判器 J1-Qwen-32B 在一些基准测试中甚至超过 o1-mini、o3 和一个大约 671B 的 DeepSeek-R1, 而仅使用合成数据进行训练. 通过对点评、配对和多任务 J1 变体的全面消融实验, 我们展示了该方法在各种随机种子、奖励策略和训练配方方面的有效性. 定性分析揭示, J1 开发出系统性的评估策略, 包括动态准则生成、参考答案创建、对初始评估的迭代自我纠正, 以及针对低质量响应的反馈生成.
关键词
引用
@article{arxiv.2505.10320,
title = {J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning},
author = {Chenxi Whitehouse and Tianlu Wang and Ping Yu and Xian Li and Jason Weston and Ilia Kulikov and Swarnadeep Saha},
journal= {arXiv preprint arXiv:2505.10320},
year = {2025}
}
备注
10 pages, 13 tables, 14 figures