众声一奖:用于LLM评判和奖励建模的多角色评分标准生成
机器学习
2026-07-02 v1
摘要
可靠的奖励和偏好信号对于评估和优化开放式任务上的大型语言模型至关重要。基于评分标准的评判器提供了一种透明的方式,将此类判断分解为明确的评估标准,但现有的无注释评分标准生成器通常依赖单一通用评估器。因此,它们可能忽略人类偏好的重要维度,我们将这种失败模式称为维度盲点。为了解决这一限制,我们提出了多角色评分标准生成(MRRG),这是一个无需训练且无需参考的框架,从多个互补角色中引出评估标准,并将其整合为可审计的基于评分标准的评分器。该评分器既可用于验证成对偏好,也可为GRPO风格的可验证奖励强化学习(RLVR)提供奖励。在偏好验证基准上的实验表明,MRRG在多个骨干模型上始终优于单角色评分标准生成基线。进一步的RLVR实验表明,MRRG为改进开放式生成提供了更强的奖励信号。
引用
@article{arxiv.2607.01830,
title = {Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling},
author = {Dazhi Fu and Jiuding Yang and Yiwen Guo and Jicong Fan},
journal= {arXiv preprint arXiv:2607.01830},
year = {2026}
}