RubricEM:基于 Rubric 指导的 Meta-RL 超越可验证奖励的策略分解
计算与语言
2026-05-12 v1 机器学习
摘要
训练深度研究代理——即计划、搜索、评估证据并综合长篇报告的系统——将强化学习推出了可验证奖励的范畴。它们的输出缺乏 ground-truth 答案,轨迹跨越许多工具增强决策,标准后训练几乎无法将过去的尝试转化为可重用经验。本文认为,Rubric 不应仅作为最终答案评估器,而应作为结构化策略执行、判断反馈和代理记忆的共享接口。基于这一观点,我们引入 RubricEM,一个 Rubric 指导的强化学习框架,结合阶段感知策略分解和基于反思的 Meta-策略演化。RubricEM 首先通过条件化于自生成 Rubric 来使研究轨迹具备阶段感,涵盖计划、证据收集、审查和综合。随后,RubricEM 使用 Stage-Structured GRPO 为其分配信用,该方法利用阶段感知 Rubric 判断为长期优化提供更稠密的语义反馈。并行地,RubricEM 训练一个共享背板的反思 Meta-策略,将被评判的轨迹提炼为可重用的 Rubric 指导。最终的 RubricEM-8B 在四个长篇研究基准测试上实现了强劲性能,超越了可比的开源模型,接近专有深度研究系统。除最终性能外,我们进行彻底分析以理解 RubricEM 的关键要素。
关键词
引用
@article{arxiv.2605.10899,
title = {RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards},
author = {Gaotang Li and Bhavana Dalvi Mishra and Zifeng Wang and Jun Yan and Yanfei Chen and Chun-Liang Li and Long T. Le and Rujun Han and George Lee and Hanghang Tong and Chen-Yu Lee and Tomas Pfister},
journal= {arXiv preprint arXiv:2605.10899},
year = {2026}
}
备注
63 pages, 6 figures