中文

推理缓存:通过短期强化学习实现长期持续改进

机器学习 2026-03-24 v2

摘要

能够在训练预算之外持续改进的大型语言模型 (LLM) 可通过在测试时进行适应来解决越来越困难的问题,这一属性我们称为外推。然而,标准强化学习 (RL) 在固定问题分布和训练预算下运行,这限制了在测试时分布迁移中的外推能力。为此,我们引入 RC—an iterative 解码算法取代训练和推理期间的标准自回归解码。RC 利用 LLM 响应生成与概述能力之间的不对称性,构建能够跨迭代持续改进的推理链。使用 RC 训练的模型可对超过训练期间所见的推理时限进行外推。经验上,用 16k token 训练预算训练 4B 模型并使用 RC,可在 HMMT 2025 测试时将性能从 40% 提升至接近 70%,仅使用 0.5m token,甚至超过了规模相当的模型和许多更大的推理 LLM。最后,我们还展示使用 RC 训练的模型能更有效地利用现有脚手架来进一步扩展测试时的性能,因为通过训练学习到的改进概述条件生成能力。

关键词

引用

@article{arxiv.2602.03773,
  title  = {Reasoning Cache: Continual Improvement Over Long Horizons via Short-Horizon RL},
  author = {Ian Wu and Yuxiao Qu and Amrith Setlur and Aviral Kumar},
  journal= {arXiv preprint arXiv:2602.03773},
  year   = {2026}
}

备注

preprint v2; revised 2026-03-22 (updated IMO-AnswerBench results)