中文

自回归思维链推理的在线学习理论

机器学习 2026-05-11 v1

摘要

自回归生成是大语言模型机制的核心。它可以被视为下一个 token 生成器的重复应用:从输入字符串(提示)开始,生成器被应用 MM 步,并将最后生成的 token 作为最终输出。[Joshi et al., 2025] 提出了一个 PAC 模型,用于研究由该过程产生的输入输出映射的可学习性。我们开发了该框架的在线类比,重点关注学习由未知下一个 token 生成器诱导的最终输出的错误界限。我们区分了两种形式的反馈。在端到端模型中,在每一轮之后,学习者仅观察到经过 MM 步自回归后生成的最终 token。在思维链模型中,学习者还会被展示完整的 MM 步轨迹。我们的目标是理解最优错误界限如何依赖于生成视界 MM,以及观察中间 token 能在多大程度上降低这种依赖。我们的主要结果表明,自回归学习的在线理论呈现出与 [Hanneke et al., 2026] 发现的统计学理论类似的定性图景,但在对生成视界的依赖尺度上有所不同。在端到端模型中,我们证明了关于生成视界 MM 中可能出现的错误界限增长率的一个分类:本质上,介于常数和对数之间的任何增长率都可能出现。我们进一步表明,这个对数上限是不可避免的。在思维链模型中,我们表明,获取完整的生成轨迹完全消除了对 MM 的依赖。我们还分析了自回归线性阈值类,并证明了最优错误界限,以及统计设定下的一个新下界。在此过程中,我们的结果解决了 [Joshi et al., 2025] 留下的几个开放问题。

关键词

引用

@article{arxiv.2605.06819,
  title  = {A Theory of Online Learning with Autoregressive Chain-of-Thought Reasoning},
  author = {Ilan Doron-Arad and Idan Mehalel and Elchanan Mossel},
  journal= {arXiv preprint arXiv:2605.06819},
  year   = {2026}
}