中文

大型语言模型的推理能力:基于抽象与推理语料的深入分析

计算与语言 2024-11-26 v3 人工智能 新兴技术 符号计算

摘要

现有评估大型语言模型(LLM)推理能力的方法主要以结果为中心,难以全面评估推理过程。我们引入一种新方法,使用抽象与推理语料(ARC)基准以过程为中心的方式评估 LLM 的推理和上下文理解能力,重点关注语言思维假说(LoTH)的三个关键组成部分:逻辑连贯性、组合性和生产力。我们精心设计的实验表明,尽管 LLM 展现出一定的推理能力,但在这三个方面仍显著落后于人类水平的推理。本文的主要贡献在于引入了 LoTH 视角,提供了一种评估推理过程的方法,这是传统以结果为导向的方法无法捕捉的,从而为人工智能系统中人类水平推理的发展提供了新见解。

关键词

引用

@article{arxiv.2403.11793,
  title  = {Reasoning Abilities of Large Language Models: In-Depth Analysis on the Abstraction and Reasoning Corpus},
  author = {Seungpil Lee and Woochang Sim and Donghyeon Shin and Wongyu Seo and Jiwon Park and Seokki Lee and Sanha Hwang and Sejin Kim and Sundong Kim},
  journal= {arXiv preprint arXiv:2403.11793},
  year   = {2024}
}