中文

CoT-Space:基于强化学习的内部慢思考理论框架

人工智能 2025-09-26 v2 计算与语言

摘要

强化学习 (RL) 已成为增强大型语言模型 (LLMs) 推理能力的关键方法,但仍存在显著的理论缺口,因为传统的基于标记的 RL 框架无法与类似链式思维 (Chain-of-Thought, CoT) 这样的复杂多步骤思维过程的推理层级性质相吻合。为此,我们提出 CoT-Space,一种新的理论框架,将 LLM 推理从离散标记预测任务重新诠释为连续推理语义空间中的优化过程。这一视角的转变充当了概念桥梁,使经典学习理论的基本原则得以重新用于分析 LLMs 的独特动力学。通过从噪声视角和风险视角分析该过程,我们展示,向最优 CoT 长度收敛是在欠拟合与过拟合之间基本权衡的自然结果。此外,广泛的实验提供了对我们理论发现的强有力经验验证。我们的框架不仅为诸如过度思考等经验现象提供了连贯解释,还为指导未来更有效、更通用的推理智能体的开发提供了坚实的理论基础。我们已在 https://github.com/ZyGan1999/CoT-Space 上开源代码。

关键词

引用

@article{arxiv.2509.04027,
  title  = {CoT-Space: A Theoretical Framework for Internal Slow-Thinking via Reinforcement Learning},
  author = {Zeyu Gan and Hao Yi and Yong Liu},
  journal= {arXiv preprint arXiv:2509.04027},
  year   = {2025}
}

备注

Preprint Edition