中文

LongWriter-Zero:通过强化学习掌握超长文本生成

计算与语言 2026-04-09 v3 人工智能 机器学习

摘要

超长文本生成是大语言模型 (LLM) 广泛期待的场景,但由于其最大生成长度限制以及随序列长度增加的整体质量下降,仍是一个显著挑战。以 LongWriter 为代表的以前的方法通常依赖于“教学”,即对合成的长篇输出进行监督微调 (SFT),但该策略高度依赖合成 SFT 数据,构建困难且成本高昂,往往缺乏连贯性和一致性,倾向于人工且结构单调。本文提出一种基于激励的 method,从零开始且不依赖任何标注或合成数据,利用强化学习 (RL) 培育 LLM 超长、高质量文本生成能力。我们从基础模型开始进行 RL 训练,类似于 R1-Zero,引导其在写作过程中进行推理以促进计划和细化。为此,我们采用专门的奖励模型引导 LLM 实现更好的长度控制、写作质量和结构格式。实验评估表明,我们的 LongWriter-Zero 模型(基于 Qwen2.5-32B 训练)在长篇写作任务中持续优于传统 SFT 方法,在 WritingBench 和 Arena-Write 上的所有指标均实现最新状态,甚至超越了 100B+ 模型如 DeepSeek R1 和 Qwen3-235B。我们在 https://huggingface.co/THU-KEG/LongWriter-Zero-32B 上开源数据和模型检查点。

关键词

引用

@article{arxiv.2506.18841,
  title  = {LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning},
  author = {Yuhao Wu and Yushi Bai and Zhiqiang Hu and Roy Ka-Wei Lee and Juanzi Li},
  journal= {arXiv preprint arXiv:2506.18841},
  year   = {2026}
}

备注

ICLR 2026 Oral