中文

Writing-RL:通过自适应课程强化学习提升长篇写作

计算与语言 2026-04-21 v2

摘要

近期大语言模型(LLMs)的进展已实现在长篇写作方面的强大表现,但当前的训练范式仍受限:监督微调(SFT)受限于资料饱和和性能上限,而以可验证奖励的强化学习(RLVR)虽在数学和代码等可验证领域取得成功,但由于缺乏真实答案,无法直接迁移到开放性的长篇写作。为了进一步提升长篇写作能力,我们提出Writing-RL:一个自适应课程强化学习框架,以超越SFT的能力提升长篇写作。该框架包含三个关键组件:基于边际的数据选择策略优先选择学习潜力高的样本、成对比较奖励机制在缺乏可验证奖励时提供判别性学习信号、动态参考调度方法通过自适应调整任务难度来适应模型性能的演进。7B规模的写作者模型实验表明,Writing-RL有效地在强大的SFT基准上提升了长篇写作性能。此外,我们观察到使用长输出RL训练的模型对长输入推理任务的泛化能力出奇地好,这为重新思考长上下文训练提供了有前景的视角。

关键词

引用

@article{arxiv.2506.05760,
  title  = {Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning},
  author = {Xuanyu Lei and Chenliang Li and Yuning Wu and Kaiming Liu and Weizhou Shen and Peng Li and Ming Yan and Fei Huang and Ya-Qin Zhang and Yang Liu},
  journal= {arXiv preprint arXiv:2506.05760},
  year   = {2026}
}

备注

Code is released at https://github.com/Tongyi-Zhiwen/Writing-RL