中文

J4R:基于等效初始状态组相对策略优化学习评判

计算与语言 2025-06-19 v3 人工智能

摘要

为了跟上大语言模型(LLM)开发的不断加快速度,模型输出评估正从依赖人工评估的耗时方式转向自动评估,即让 LLM 本身评估和批评其他模型的输出。LLM-as-judge 模型是一类在评估相对简单领域(如聊天质量)方面表现突出的生成式评估器,但在推理密集型领域表现不佳,这些领域的模型响应包含更多实质性且具挑战性的内容。为弥补现有评判器的不足,我们探索了使用强化学习(RL)训练评判器的做法。我们做出了三个关键贡献:(1)我们提出了等效初始状态组相对策略优化(EIS-GRPO)算法,使我们能够训练鲁棒性强的评判器,以应对更复杂评估环境中出现的positional biases。(2)我们引入了 ReasoningJudgeBench,评估 judges 在先前工作未覆盖的多样化推理环境中的表现。(3)我们训练了一个 7B 评判器(J4R),使用 EIS-GRPO 训练,该模型在 JudgeBench 和 ReasoningJudgeBench 上均优于 GPT-4o 和下一名较好的小型评判器 6.7% 和 9%,在准确性上与更大的 GRPO 训练评判器相当或更好。

关键词

引用

@article{arxiv.2505.13346,
  title  = {J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization},
  author = {Austin Xu and Yilun Zhou and Xuan-Phi Nguyen and Caiming Xiong and Shafiq Joty},
  journal= {arXiv preprint arXiv:2505.13346},
  year   = {2025}
}

备注

25 pages, 4 figures, 6 tables. Updated with code and benchmark