超越长度比例:深度与宽度协同的生成奖励模型
人工智能
2026-03-03 v1
摘要
近期生成式奖励模型(GRMs)的进展表明,链式思考(CoT)长度的扩展显著提升了评估可靠性。然而,当前研究主要依赖无结构的长度比例扩展,忽略了不同推理机制(广度CoT(B-CoT,即多维原理覆盖)和深度CoT(D-CoT,即实质性判断严谨性))的差异化效果。为此,我们引入Mix-GRM框架,通过模块化合成管道重新构架原始论证为结构化的B-CoT和D-CoT,随后采用监督微调(SFT)和可验证奖励强化学习(RLVR)内化并优化这些机制。综合实验表明,Mix-GRM在五个基准测试中建立了新的最佳状态,平均超越领先的开源奖励模型8.2%。我们的结果揭示了推理的明显分化:B-CoT在主观偏好任务中表现突出,而D-CoT在客观正确性任务中卓越。因此,推理机制与任务不匹配将直接降低性能。进一步,我们展示了RLVR作为开关放大器,可引发极化现象,使模型在自主分配推理风格以匹配任务需求方面实现突破。合成数据和模型已发布于\href{https://huggingface.co/collections/DonJoey/mix-grm}{Hugging Face},代码发布于\href{https://github.com/Don-Joey/Mix-GRM}{Github}。
引用
@article{arxiv.2603.01571,
title = {Beyond Length Scaling: Synergizing Breadth and Depth for Generative Reward Models},
author = {Qiyuan Zhang and Yufei Wang and Tianhe Wu and Can Xu and Qingfeng Sun and Kai Zheng and Xue Liu and Chen Ma},
journal= {arXiv preprint arXiv:2603.01571},
year = {2026}
}