CompassJudger-2:通过可验证奖励实现通用评判模型
计算与语言
2025-07-15 v1 人工智能
摘要
最近,LLM 评判在评估大型语言模型方面受到关注。然而,当前评判模型受限于狭义专业化和有限鲁棒性,削弱了其综合评估能力。本文提出 CompassJudger-2,一种通过任务驱动的多域数据策划策略克服这些限制的通用评判模型。我们的核心方法是通过可验证奖励监督评判任务,通过拒绝采样培养内在批判性推理,从而培育稳健、通用性强的评判能力。我们引入细化的学习目标,采用边际策略梯度损失以提升性能。经验上,CompassJudger-2 在多个评判和奖励基准上取得优异成绩,我们的 7B 模型在准确性上与更大规模的 DeepSeek-V3 和 Qwen3-235B-A22B 相当。此外,我们提出 JudgerBenchV2,一个综合性基准,用于评估跨域评判准确性和排名一致性,以标准化评判模型评估。这些贡献推动了稳健、可扩展的 LLM 评判,确立了新的性能和评估标准。
引用
@article{arxiv.2507.09104,
title = {CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards},
author = {Taolin Zhang and Maosong Cao and Alexander Lam and Songyang Zhang and Kai Chen},
journal= {arXiv preprint arXiv:2507.09104},
year = {2025}
}