关于推理:链律令牌复杂度的 BAPO 界限
人工智能
2026-05-29 v2 形式语言与自动机理论
机器学习
摘要
通过链律推理(chain-of-thought, CoT)实现的推理时间扩展是当前大型语言模型(LLM)性能提升的主要驱动力之一,但伴随着显著的延迟和计算成本。我们解决一个根本性理论问题:随输入规模增大,解决问题所需的推理令牌数为多少?通过扩展受限注意前缀oracle(BAPO)模型——一种抽象化大型语言模型的框架,量化解决任务所需的信息流——我们证明了对于三个经典BAPO-hard任务(二进制多数、三元组匹配和图可达性)所需的CoT令牌数的下界。我们展示,每个任务在输入大小为 时都需要 个推理令牌。我们通过显式构造补足这些结果,提供匹配或近似匹配的上界。最终,我们的实验表明,在这些任务上,前沿推理模型的推理令牌扩展约为线性,并且在受限于较小推理预算的情况下会失败,这与我们的理论下界相符。总体而言,我们的结果识别了通过CoT实现的推理计算的根本性瓶颈,并为分析最优推理长度提供了原则性工具。
引用
@article{arxiv.2602.02909,
title = {Reasoning about Reasoning: BAPO Bounds on Chain-of-Thought Token Complexity in LLMs},
author = {Kiran Tomlinson and Tobias Schnabel and Adith Swaminathan and Jennifer Neville},
journal= {arXiv preprint arXiv:2602.02909},
year = {2026}
}
备注
31 pages; accepted to ICML '26