中文

基于连续思维 Markov 链的深度思考

机器学习 2026-05-05 v2

摘要

基于 Transformer 的模型能够通过逐个 token 生成推理路径来执行复杂的推理。虽然这种方法有效,但通常需要生成数千个 token 才能解决单个问题,这可能速度缓慢且计算成本高昂。更重要的是,它在每个时间步结束时涉及离散采样操作,在时间步之间造成了信息瓶颈。在本工作中,我们提出了 MarCos,一种对 Transformer 结构的改进,允许在思维层面进行完全连续的推理。传统的 Transformer 层侧重于在每个时间步细化 token 预测,而 MarCos 中的层则将逐步思维的连续表示映射到下一步思维的分布。这使我们能够在 MarCos 的单次传递中实现多步推理。在合成和真实世界数学任务上的初步实验结果展示了 MarCos 的巨大潜力。值得注意的是,我们观察到 MarCos 增加的信息带宽激发了并行思考的能力,这与传统 Transformer 中的单线程思考形成对比。同时,在真实世界数学任务中,MarCos 在相同准确率水平下实现了超过 10×10\times 的实际运行时间加速。我们的代码可在 https://github.com/Ljyustc/MarCos 获取。

关键词

引用

@article{arxiv.2509.25020,
  title  = {Deep Thinking by Markov Chain of Continuous Thoughts},
  author = {Jiayu Liu and Zhenya Huang and Xuan Yang and Tianyun Ji and Anya Sims and Hao Xu and Enhong Chen and Yee Whye Teh and Ning Miao},
  journal= {arXiv preprint arXiv:2509.25020},
  year   = {2026}
}