中文

大型语言模型模仿逻辑推理,但代价为何?

人工智能 2025-09-17 v1 计算机科学中的逻辑

摘要

我们提出了一项纵向研究,评估了前沿大型语言模型在十八个月期间的推理能力。我们测量了来自 2023 年 12 月、2024 年 9 月与 2025 年 6 月的三个领先模型在 PrOntoQA 数据集判断题上的准确性,以及它们对通过上下文学习提供的推理策略的忠实度。2023 年至 2024 年的性能提升可归因于隐式的思维链提示。思考模型的引入使得 2024 年至 2025 年间模型性能获得了显著提升。随后,我们提出了一种神经符号架构,该架构使用少于 150 亿参数的 LLM 将问题转化为标准化形式。接着,我们将问题的标准化形式解析为程序,由 SMT 求解器 Z3 进行求解,以判定查询的可满足性。我们报告了开源模型的提示与补全 token 数量以及以 FLOPs 为单位的计算成本。该神经符号方法在保持近乎完美性能的同时显著降低了计算成本。在所有实验中,推理 FLOPs 数量约为活跃参数与总 token 数乘积两倍的常见近似估计在 10% 的误差范围内是准确的。

关键词

引用

@article{arxiv.2509.12645,
  title  = {Large Language Models Imitate Logical Reasoning, but at what Cost?},
  author = {Lachlan McGinness and Peter Baumgartner},
  journal= {arXiv preprint arXiv:2509.12645},
  year   = {2025}
}

备注

This work has been accepted as a main track paper for publication in the proceedings of the Australasian Joint Conference on Artificial Intelligence 2025 held in Canberra, Australia