中文

InftyThink+:通过强化学习实现高效的无限视野推理

计算与语言 2026-02-10 v2 人工智能

摘要

大型推理模型通过扩大推理时间链步来实现卓越性能,但该范式受制于二次计算成本、上下文长度限制以及因信息丢失导致的推理性能下降。迭代推理通过定期总结中间思考来缓解这些问题,但现有方法依赖监督学习或固定启发式,无法优化何时总结、总结什么内容以及如何恢复推理。我们提出InftyThink+,一个端到端的强化学习框架,用于优化整个迭代推理轨迹,基于模型控制的迭代边界和显式总结。在训练阶段,InftyThink+采用监督 cold-start 后跟随轨迹级强化学习的两阶段方案,使模型能够学习战略性的总结和继续决策。在DeepSeek-R1-Distill-Qwen-1.5B模型上的实验表明,InftyThink+在AIME24上实现了21%的准确率提升,显著优于常规长链步强化学习方法,同时在更广泛的分布外基准测试中表现出更好的泛化能力。此外,InftyThink+显著降低了推理延迟,加速了强化学习训练,展示了在保持更强性能的同时,推理效率也得到了显著提升。

关键词

引用

@article{arxiv.2602.06960,
  title  = {InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning},
  author = {Yuchen Yan and Liang Jiang and Jin Jiang and Shuaicheng Li and Zujie Wen and Zhiqiang Zhang and Jun Zhou and Jian Shao and Yueting Zhuang and Yongliang Shen},
  journal= {arXiv preprint arXiv:2602.06960},
  year   = {2026}
}

备注

Project Page: https://zju-real.github.io/InftyThink-Plus Code: https://github.com/ZJU-REAL/InftyThink-Plus