批判性思维:哪种复杂度主导最优推理长度?
人工智能
2025-04-03 v1
摘要
大型语言模型(LLM)在推理时常通过口头化推理获得显著提升,但仍不明确这些额外推理标记(token)究竟针对哪些任务难度维度。为探究此问题,我们构建了一个基于确定性有限自动机(DFA)的框架。DFA 通过可衡量的属性(如运行长度——所需推理步骤数、状态空间大小——决策复杂度)来刻画任务复杂度。我们首先表明,在不同任务、不同规模和训练范式的模型中,存在一种最优的推理token数量,可最大化解题正确率的概率。随后我们探讨哪些复杂度属性主导了这一临界长度:我们发现,运行时长更长的任务实例(即对潜在状态跟踪需求更大)与更长的推理长度相关,但令人惊讶的是,DFA的规模(即状态空间复杂度)并不相关。我们进一步展示了这些发现的一个含义:通过预测新问题的最优推理token数,并筛选出非最优长度的答案,可实现持续的准确率提升。
引用
@article{arxiv.2504.01935,
title = {Critical Thinking: Which Kinds of Complexity Govern Optimal Reasoning Length?},
author = {Celine Lee and Alexander M. Rush and Keyon Vafa},
journal= {arXiv preprint arXiv:2504.01935},
year = {2025}
}