ZebraLogic:大语言模型逻辑推理的扩展极限研究
人工智能
2025-07-16 v2 计算与语言
机器学习
摘要
我们研究大语言模型(LLM)的逻辑推理能力及其在复杂非单调推理中的可扩展性。为此,我们引入ZebraLogic,一个基于约束满足问题(CSP)生成的逻辑网格谜题的综合评估框架,用于评估LLM的推理性能。ZebraLogic能够生成复杂度可控且可量化的谜题,便于系统研究Llama、o1模型和DeepSeek-R1等模型的扩展极限。通过涵盖广泛的搜索空间复杂度和多样的逻辑约束,ZebraLogic提供了一个结构化环境,以评估在递增难度下的推理能力。我们的结果揭示了随着问题复杂度增长,准确率显著下降——我们将此现象称为复杂度诅咒。即使使用更大的模型和增加推理时计算,这一限制依然存在,表明当前LLM推理能力存在固有局限。此外,我们探索了增强逻辑推理的策略,包括Best-of-N采样、回溯机制和自我验证提示。我们的发现为LLM推理的可扩展性提供了关键见解,揭示了根本性限制,并指出了潜在的改进方向。
引用
@article{arxiv.2502.01100,
title = {ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning},
author = {Bill Yuchen Lin and Ronan Le Bras and Kyle Richardson and Ashish Sabharwal and Radha Poovendran and Peter Clark and Yejin Choi},
journal= {arXiv preprint arXiv:2502.01100},
year = {2025}
}
备注
Accepted to ICML 2025