中文

SPELL:用于演化长上下文语言模型的自我对弈强化学习

计算与语言 2026-03-16 v4

摘要

大型语言模型(LLM)在长上下文推理方面的进展滞后于其他近期突破。这一差距不仅源于处理长文本的内在困难,还源于可靠人工标注稀缺以及程序化可验证奖励信号的不足。本文提出了SPELL——一种多角色自我对弈强化学习框架,通过内置问家、答家和验家三个循环角色,实现了针对长上下文推理的可扩展、无标签优化。SPELL在单个模型内部集成了这三个角色,以实现持续自我提升。问家从原始文档及其对应的参考答案生成问题;答家基于文档学习解答这些问题;验家评估答家输出与问家参考答案之间的语义等价性,产生奖励信号以指导持续训练。为稳定训练,我们引入了渐进增加文档长度的自动课程,并设计适应模型能力演变的奖励函数。对六个长上下文基准进行大量实验表明,SPELL在 diverse LLMs 上均能稳定提升性能,优于同等规模的模型(后者使用大规模标注数据微调)。值得注意的是,SPELL在强推理模型 Qwen3-30B-A3B-Thinking 上实现了 pass@8 平均提升 7.6 分,显著提升了性能上限,展示了向更强大模型扩展的潜力。我们的代码已公开于 https://github.com/Tongyi-Zhiwen/Qwen-Doc。

关键词

引用

@article{arxiv.2509.23863,
  title  = {SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models},
  author = {Ziyi Yang and Weizhou Shen and Chenliang Li and Ruijun Chen and Fanqi Wan and Ming Yan and Xiaojun Quan and Fei Huang},
  journal= {arXiv preprint arXiv:2509.23863},
  year   = {2026}
}

备注

Accepted to ICLR 2026