从推理到泛化:面向ARC基准测试的知识增强型大语言模型
人工智能
2025-05-26 v1 计算与语言
摘要
最近的面向推理的大语言模型在数学和科学考试等具有挑战性的任务上展现了强劲表现。然而,人类智能的核心认知能力,如抽象推理和泛化,仍然未被充分探索。为了解决这一问题,我们在抽象与推理语料库(ARC)基准测试上评估了最近的面向推理的大语言模型,该基准测试明确要求这两项能力。我们将ARC形式化为程序合成任务,并提出了九种候选求解器。实验结果表明,重复采样规划辅助代码生成(RSPC)取得了最高的测试准确率,并在大多数LLM上展现出一致的泛化能力。为了进一步提升性能,我们引入了一种ARC求解器——面向抽象推理的知识增强(KAAR),它在一个本体中编码核心知识先验,并根据其依赖关系将先验分为三个层次级别。KAAR通过逐步增强每个级别的先验来渐进式地扩展LLM的推理能力,并在每个增强阶段后调用RSPC生成候选解决方案。这种分阶段推理减少了无关先验的干扰并提升了LLM的性能。实证结果表明,KAAR保持了强大的泛化能力,并在所有评估的LLM上一致优于未增强的RSPC,实现了约5%的绝对提升和高达64.52%的相对改进。尽管取得了这些成就,ARC仍然是面向推理的大语言模型的一个具有挑战性的基准测试,为LLM的未来进步指明了方向。
引用
@article{arxiv.2505.17482,
title = {From Reasoning to Generalization: Knowledge-Augmented LLMs for ARC Benchmark},
author = {Chao Lei and Nir Lipovetzky and Krista A. Ehinger and Yanchuan Chang},
journal= {arXiv preprint arXiv:2505.17482},
year = {2025}
}