马尔可夫式思考者:推理的无感知架构线性扩展
机器学习
2025-11-14 v3 人工智能
计算与语言
摘要
强化学习(RL)最近成为训练产生长链思考(LongCoT)的推理大语言模型的强有力方法。然而,标准的RL“思考环境”中,状态是提示加上所有先前推理标记,使得状态无界,迫使基于注意力的策略在思考长度增加时承担二次计算开销。我们重新审视该环境本身。我们提出马尔可夫式思考(Markovian Thinking)范式,即在常数大小状态上进行推理,使推理长度与上下文大小分离。作为直接结果,这导致计算线性增长且保持常数内存。我们以Delethink为例实现这一思想,在每个思考块内部模型照常思考;在块边界处,环境重置上下文并用简短的携带信息重新初始化提示。在RL训练下,策略学习编写每个块末尾的文本状态,以在重置后无缝延续推理。经过训练的R1-Distill 1.5B模型在8K-token块中推理,却能思考最长达24K tokens,匹配或超越使用24K预算训练的LongCoT-RL。通过测试时扩展,Delethink持续改进,而LongCoT在此过程中遇到的停滞。线性计算的实际效果显著:我们经验性估计,在平均思考长度为96K时,LongCoT-RL需要27个H100月,而Delethink仅需7个H100月。分析RL初始化时,发现即便是1.5B至120B的即插即用推理模型常常在各种基准测试中零-shot采样马尔可夫轨迹,提供正样本,使规模RL效果显著。我们的结果表明,重新设计思考环境是一个强大的杠杆:它使非常长的推理成为可能且无需二次开销,为高效可扩展推理大语言模型开辟了道路。
引用
@article{arxiv.2510.06557,
title = {The Markovian Thinker: Architecture-Agnostic Linear Scaling of Reasoning},
author = {Milad Aghajohari and Kamran Chitsaz and Amirhossein Kazemnejad and Sarath Chandar and Alessandro Sordoni and Aaron Courville and Siva Reddy},
journal= {arXiv preprint arXiv:2510.06557},
year = {2025}
}