Writing-Zero:弥合不可验证任务与可验证奖励之间的差距
计算与语言
2025-06-12 v2
摘要
带有可验证奖励的强化学习(RLVR)使大语言模型在具有客观标准答案的推理任务(如数学和代码生成)中取得了显著突破。然而,对于创意写作和开放式对话等不可验证任务,由于其质量评估本质上具有主观性且缺乏确定的参考标准,仍然存在显著差距。针对这些领域的现有方法通常依赖于基于人类偏好训练的标量奖励模型,这些模型泛化能力有限且容易受到奖励黑客的影响,例如过度解释和长度偏差。在本工作中,我们提出了一种统一的基于 RLVR 的训练范式,以弥合不可验证任务与可验证奖励之间的差距。我们引入了基于写作原则的成对生成式奖励模型和一种新颖的自举相对策略优化算法。成对写作 GenRM 利用自我原则评判将主观评估转化为可靠、可验证的奖励,而 BRPO 通过在 RL 训练期间利用组内展开中的自举响应作为临时参考,实现了动态的、无需参考的成对比较。我们的方法使 LLMs 无需监督微调即可发展出稳健的写作能力,如 Writing-Zero 所展示的那样,与标量奖励基线相比,它表现出持续的改进和对奖励黑客的强抵抗力。此外,我们的方法在内部和开源写作基准测试上均取得了有竞争力的结果。我们的发现表明,在 RLVR 框架下统一基于规则的、基于参考的和无需参考的奖励建模具有潜力,从而为适用于所有语言任务的全面且可扩展的 RL 训练范式铺平道路。
引用
@article{arxiv.2506.00103,
title = {Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards},
author = {Ruipeng Jia and Yunyi Yang and Yongbo Gai and Kai Luo and Shihao Huang and Jianhe Lin and Xiaoxi Jiang and Guanjun Jiang},
journal= {arXiv preprint arXiv:2506.00103},
year = {2025}
}