RUBRIC-ARROW:用于非可验证领域 LLM 后训练的交替点评制和奖励建模
机器学习
2026-05-29 v1 计算与语言
摘要
点评奖励建模为 LLM 后训练提供了关键信号,但在主观且不可验证的场景中难以进行绝对评分。基于制度的方法通过将评估分解为显式标准来解决这一问题,但现有方法通常依赖前沿 LLM,且受由硬性布尔聚合导致的平局问题。我们提出 RUBRIC-ARROW,一种交替框架,联合训练制度生成器和制度条件评判器,其 RL 阶段仅使用两两偏好数据。该方法结合基于概率的评分规则以减少平局,以及相位特定的基于偏好的奖励和交替 GRPO 方案,以联合训练点评评估器。大量实验表明,RUBRIC-ARROW 在奖励建模准确性方面达到竞争水平,并为下游策略后训练带来持续的性能提升。
引用
@article{arxiv.2605.29156,
title = {RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains},
author = {Haoxiang Jiang and Zihan Dong and Tianci Liu and Wanying Wang and Ran Xu and Tony Yu and Linjun Zhang and Haoyu Wang},
journal= {arXiv preprint arXiv:2605.29156},
year = {2026}
}