中文

基于工具驱动的多跳表格问答任务探索大语言模型的元层推理

计算与语言 2026-01-13 v1

摘要

近期大语言模型 (LLM) 的进展日益聚焦于"推理"能力,而该概念在LLM话语中存在许多重叠定义。我们采用更结构化的方法,区分元层推理(指解决任务所需中间步骤的推理过程)与对象层推理(关注前述步骤的低层执行)。我们设计了一项新颖的问答任务,围绕 various countries over various years 的地缘指标值展开。问题要求分解为中间步骤、数据检索以及对该数据的数学运算。通过检查LLM选择合适工具以回答问题的方式来分析其元层推理能力。为超越最终答案准确率对LLM进行深入分析,我们的任务包含\'essential actions\',可用于比较LLM的工具调用输出,以推断其推理能力强度。我们发现LLM在本任务上表现出良好的元层推理,但在某些任务理解方面存在缺陷。我们发现n-shot提示对准确率影响不大;遇到的错误信息并不常导致性能下降;并提供更多LLM numeracy 差励的证据。最后,我们讨论了发现对其他任务领域的概括性与局限性。

关键词

引用

@article{arxiv.2601.07696,
  title  = {Exploring the Meta-level Reasoning of Large Language Models via a Tool-based Multi-hop Tabular Question Answering Task},
  author = {Nick Ferguson and Alan Bundy and Kwabena Nuamah},
  journal= {arXiv preprint arXiv:2601.07696},
  year   = {2026}
}