中文

LongR:通过稠密效用奖励的强化学习实现长程推理

计算与语言 2026-02-06 v1

摘要

强化学习已成为大语言模型推理能力的关键驱动力。这一能力在长程场景中同样至关重要——例如长对话理解和结构化数据分析,其中挑战不仅在于消耗标记,更在于进行严谨的推理。虽然已有工作聚焦于数据合成或架构更改,但近期研究指出,仅依赖稀疏、结果导向的奖励导致收益有限,因为粗糙信号往往不足以有效引导复杂的长程推理。为此,我们提出LongR框架,通过集成动态“思考-阅读”机制,将推理与文档咨询交织,同时引入基于相对信息增益的情境密度奖励来量化相关文档的实用性。经验上,LongR在LongBench v2上实现了9%的提升,并在RULER和InfiniteBench上持续改进,显示出在处理广泛上下文方面的稳健效率。此外,LongR在 diverse RL算法(如DAPO、GSPO)上均能持续提升性能。我们进行深入分析,探讨推理链长度对效率和模型对干扰项的鲁棒性的影响。

关键词

引用

@article{arxiv.2602.05758,
  title  = {LongR: Unleashing Long-Context Reasoning via Reinforcement Learning with Dense Utility Rewards},
  author = {Bowen Ping and Zijun Chen and Yiyao Yu and Tingfeng Hui and Junchi Yan and Baobao Chang},
  journal= {arXiv preprint arXiv:2602.05758},
  year   = {2026}
}