学习推理机制Ⅰ:TempoBench——面向可解释推理系统性能解构的基准测试
人工智能
2025-11-03 v1 形式语言与自动机理论
摘要
大型语言模型(LLM)在越来越多的任务上超越并超越人类表现。然而,要提升LLM的推理能力,研究者要么依赖 ad-hoc 生成的数据集,要么依赖像Lean证明助手等形式化数学证明系统。虽然 ad-hoc 生成的方法可以捕捉真实世界推理过程的决策链,但可能在其覆盖的推理空间中编码某种无意 bias;它们也无法获得形式化验证。另一方面,像Lean这样的系统可以保证可验证性,但不适合捕捉以智能体决策链为特征的任务。这两种方法在业务智能体或代码助手等功能上都表现不足,而LLM推理基准测试在推理结构或现实对齐性方面也不足。我们引入TempoBench,这是第一个在形式上具有可验证性且可参数化难度的诊断性基准测试,用于系统性分析LLM的推理表现。TempoBench 使用两个评估基准来分解推理能力。首先,时间轨迹评估(TTE)测试LLM理解和模拟给定多步骤推理系统执行的能力。随后,时间因果评估(TCE)测试LLM进行多步骤因果推理的能力,并从复杂系统中提炼因果关系。我们发现模型在TCE-normal上的得分为65.6%,而在TCE-hard上仅为7.5%。这表明最先进的LLM clearly 理解TCE任务,但在系统复杂度提升时表现较差。我们的代码已在GitHub仓库中公开。
引用
@article{arxiv.2510.27544,
title = {Mechanics of Learned Reasoning 1: TempoBench, A Benchmark for Interpretable Deconstruction of Reasoning System Performance},
author = {Nikolaus Holzer and William Fishell and Baishakhi Ray and Mark Santolucito},
journal= {arXiv preprint arXiv:2510.27544},
year = {2025}
}