中文

无人 supervision 下扩展奖励建模

机器学习 2026-03-17 v2

摘要

学习反馈是推进前沿模型能力和安全性的关键过程,但其有效性常受制于成本和可扩展性。我们提出一项试点研究,探索通过无监督方法扩展奖励模型。我们将奖励基于扩展(Reward-based scaling, RBS) operationalize为对来自大规模网络语料中抽取的文档前缀和后缀进行偏好学习。其优势在于:尽管无需人工标注,在1100万token的以数学为导向的网络数据上训练,即可获得RewardBench v1和v2上的稳步提升,这些改进在各种初始化 backbone 跨模型家族和规模的迁移中保持一致。在所有模型上,我们的方法使RewardBench v2准确率提升最高可达+7.7分,在领域内数学子集上提升最高可达+16.1分,并在领域外安全和通用子集上实现持续改进。当应用于最佳-N选择和策略优化时,这些奖励模型显著提升了下游数学性能,甚至匹配或超越了规模相似的强监督奖励模型基线。总体而言,我们展示了在无需高成本且可能不可靠的人工标注情况下训练奖励模型的可行性与前景。

关键词

引用

@article{arxiv.2603.02225,
  title  = {Scaling Reward Modeling without Human Supervision},
  author = {Jingxuan Fan and Yueying Li and Zhenting Qi and Dinghuai Zhang and Kianté Brantley and Sham M. Kakade and Hanlin Zhang},
  journal= {arXiv preprint arXiv:2603.02225},
  year   = {2026}
}