中文

大语言模型在有限离散状态空间问题上的复杂度诱导极限的实证研究

计算与语言 2026-04-16 v1

摘要

大语言模型 (LLM) 正日益被描述为具备强大的推理能力,这一点在数学、逻辑和规划基准测试中得到了高水平性能的支持。然而,大多数现有评估依赖于固定数据集上的总体准确率,掩盖了推理行为随任务复杂度变化的演化过程。本文引入一个受控的基准框架,系统评估大型推理模型 (LRM) 在逐步增加问题复杂度下的鲁棒性。我们构建了一个包含九个经典推理任务的套件:布尔满足问题、 cryptarithmetic、图着色、河越、塔塔 Hanoi、水壶、检查跳跃、数独和 Rubik's Cube,每个任务的参数化设计以精确控制复杂度,同时保持底层语义。通过确定性验证器,对多个开放和专有 LRM 在低、中等和高复杂度情景下进行评估,确保只有完全有效的解决方案才被接受。我们的结果揭示了一种类似相位转变的现象:模型在低复杂度下取得高准确率,但在超过特定任务阈值的复杂度后迅速下降。我们将这一现象正式定义为推理崩溃。在各种任务中,观察到准确率显著下降,常常下降超过 50%,伴随推理痕迹不一致、约束违反、状态跟踪丢失以及自信的错误输出。增加推理长度并不可靠地提高正确性,一个问题家族中的收益也不一定能推广到其他问题家族。这些发现凸显了需要超越静态基准的评估方法,以及在受控复杂度下显式测量推理鲁棒性的必要性。

关键词

引用

@article{arxiv.2604.13371,
  title  = {Empirical Evidence of Complexity-Induced Limits in Large Language Models on Finite Discrete State-Space Problems with Explicit Validity Constraints},
  author = {Md. Fahad Ullah Utsho and Mohd. Ruhul Ameen and Akif Islam and Md. Golam Rashed and Dipankar Das},
  journal= {arXiv preprint arXiv:2604.13371},
  year   = {2026}
}

备注

45 pages, 36 figures, 7 tables, Journal Preprint