中文

自回归推理的样本复杂度:链式思维 vs. 端到端

机器学习 2026-04-21 v2

摘要

现代大型语言模型以自回归方式生成文本,逐个产生标记。为研究此类系统的可学习性,Joshi 等人(COLT 2025)引入了针对下一个标记生成器的PAC学习框架,这是自回归模型的基本底层。 在该框架中,未知的下一个标记生成器将一序列的标记映射到下一个标记,并迭代应用 TT 步,产生一系列标记,其最终标记构成模型的输出。学习任务是学习由此自回归过程诱导的输入-输出映射。 Depending on the available supervision, training examples may reveal only the final output (End-to-End supervision) or the entire generated chain (Chain-of-Thought supervision)。这提出了两个自然问题:样本复杂度如何依赖于生成长度 TT,以及链式思维监督能否显著降低这种依赖。在本文中,我们通过揭示样本复杂度随 TT 缩放的分类法,几乎完全回答了这两个问题。对于端到端学习,我们展示该图景异常丰富:在轻度条件下,几乎任何介于常数与线性之间的增长率 r(T)r(T) 都可能作为样本复杂度,而结合Joshi 等人的线性上界,这给出了近乎完整的表征。相比之下,在链式思维监督下,我们表明样本复杂度与 TT 无关,表明对中间推理步骤的访问可完全消除对生成长度的依赖。我们的分析引入了新的组合工具,作为推论,我们解决了Joshi 等人关于生成长度和链式思维监督在可学习性方面的若干开放问题。

关键词

引用

@article{arxiv.2604.12013,
  title  = {Sample Complexity of Autoregressive Reasoning: Chain-of-Thought vs. End-to-End},
  author = {Steve Hanneke and Idan Mehalel and Shay Moran},
  journal= {arXiv preprint arXiv:2604.12013},
  year   = {2026}
}