大型语言模型的推理能力:来自通用游戏测试的经验教训
人工智能
2026-02-24 v1 计算与语言
计算机科学中的逻辑
摘要
本文从新颖的视角考察大型语言模型(LLM)的推理能力,聚焦于其在形式规定、规则驱动环境中的运作能力。我们在广泛的推理问题中评估了四个LLM(Gemini 2.5 Pro和Flash变体、Llama 3.3 70B和GPT-OSS 120B),这些问题通过通用游戏测试(GGP)实例表现为前向模拟任务,包括下一步状态构建、多步状态构建以及合法动作生成。除了报告实例级性能外,我们还基于40个结构特征对游戏进行特征化,并分析这些特征与LLM性能之间的相关性。此外,我们调查了各种游戏混淆措施的效果,以 assessing 语言语义在游戏定义中的作用以及LLM在训练期间对特定游戏的潜在暴露问题。主要结果表明,评估的三个模型在大多数实验环境中表现良好,随着评估视野的增加(即随着游戏步数的增加),性能会下降。对LLM性能的详细案例分析提供了关于所考虑逻辑基于问题表述中常见推理错误的新见解,包括幻觉规则、冗余状态事实或语法错误。总体而言,本文报告了当代模型在形式推理能力方面取得的明确进展。
引用
@article{arxiv.2602.19160,
title = {Reasoning Capabilities of Large Language Models. Lessons Learned from General Game Playing},
author = {Maciej Świechowski and Adam Żychowski and Jacek Mańdziuk},
journal= {arXiv preprint arXiv:2602.19160},
year = {2026}
}