Think-J:学习如何思考的生成式 LLM-Judge
计算与语言
2026-01-13 v2 人工智能
摘要
LLM-as-a-Judge 指的是自动建模 Large Language Models (LLMs) 生成响应的偏好,这对于 LLM 评估和奖励建模都具有重要重要性。尽管生成式 LLM 在 various 任务中取得了显著进展,但其作为 LLM-Judge 的性能仍未达到预期。本文提出了 Think-J,通过学习如何思考来提高生成式 LLM-as-a-Judge 的性能。我们首先利用少量精选数据开发具有初始判断思考能力的模型。随后,我们基于强化学习 (RL) 优化判断思考轨迹。我们提出了两种用于判断思考优化的方法,分别基于离线和在线 RL。离线方法需要训练一个 critic 模型来构建正负示例以进行学习。online 方法定义基于规则的奖励作为优化反馈。实验结果表明,我们的方法显著增强了生成式 LLM-Judge 的评估能力,超越了基于生成和基于分类的 LLM-Judge,且无需额外的人类标注。
引用
@article{arxiv.2505.14268,
title = {Think-J: Learning to Think for Generative LLM-as-a-Judge},
author = {Hui Huang and Yancheng He and Hongli Zhou and Rui Zhang and Wei Liu and Weixun Wang and Jiaheng Liu and Wenbo Su},
journal= {arXiv preprint arXiv:2505.14268},
year = {2026}
}
备注
Accepted by AAAI2026