大型语言模型的推理能力:基于抽象与推理语料的深入分析
计算与语言
2024-11-26 v3 人工智能
新兴技术
符号计算
摘要
现有评估大型语言模型(LLM)推理能力的方法主要以结果为中心,难以全面评估推理过程。我们引入一种新方法,使用抽象与推理语料(ARC)基准以过程为中心的方式评估 LLM 的推理和上下文理解能力,重点关注语言思维假说(LoTH)的三个关键组成部分:逻辑连贯性、组合性和生产力。我们精心设计的实验表明,尽管 LLM 展现出一定的推理能力,但在这三个方面仍显著落后于人类水平的推理。本文的主要贡献在于引入了 LoTH 视角,提供了一种评估推理过程的方法,这是传统以结果为导向的方法无法捕捉的,从而为人工智能系统中人类水平推理的发展提供了新见解。
引用
@article{arxiv.2403.11793,
title = {Reasoning Abilities of Large Language Models: In-Depth Analysis on the Abstraction and Reasoning Corpus},
author = {Seungpil Lee and Woochang Sim and Donghyeon Shin and Wongyu Seo and Jiwon Park and Seokki Lee and Sanha Hwang and Sejin Kim and Sundong Kim},
journal= {arXiv preprint arXiv:2403.11793},
year = {2024}
}