FCoReBench:大型语言模型能解决具有挑战性的的一阶组合推理问题吗?
人工智能
2025-03-04 v3 计算与语言
机器学习
摘要
大型语言模型 (LLMs) 能解决具有挑战性的的一阶组合推理问题(如图着色、背包问题和 cryptarithmetic)吗?所谓一阶,是指这些问题可以实例化为潜在无限数量且规模各异的问题实例。它们也具有挑战性,因为是 NP-hard 问题且需要多个推理步骤才能得出解决方案。虽然现有工作专注于构建具有困难基准的数据集,但利用问题结构的一阶性质的工作有限。为应对这一挑战,我们提出了 FCoReBench,这是一个包含 40 个此类挑战性问题的数据集,附带用于生成不同规模问题实例的脚本,并能自动验证和生成其解决方案。我们首先观察到,即使有符号求解器辅助,LLMs 在我们的数据集上表现也相当差,无法利用这些问题的底层结构。我们特别观察到随着问题规模增加,性能下降。为此,我们提出了一种新方法 SymPro-LM,它将 LLMs 与符号求解器和程序解释器相结合,并利用少量已解决示例的反馈,从而实现巨大的性能提升。我们提出的方法对问题规模的变化具有鲁棒性,并具有一个独特的特征:与早期方法不同,它在推理期间不需要任何 LLM 调用。作为额外实验,我们还展示了 SymPro-LM 在其他逻辑推理基准上的有效性。
引用
@article{arxiv.2402.02611,
title = {FCoReBench: Can Large Language Models Solve Challenging First-Order Combinatorial Reasoning Problems?},
author = {Chinmay Mittal and Krishna Kartik and Mausam and Parag Singla},
journal= {arXiv preprint arXiv:2402.02611},
year = {2025}
}