LLM 与抽象与推理语料库:成功、失败以及基于对象的表征的重要性
计算与语言
2024-02-16 v2 人工智能
摘要
大语言模型(LLM)能否解决简单的抽象推理问题?我们通过系统性分析 GPT 在抽象与推理语料库(ARC)上的表现来探讨这一宽泛问题;ARC 是一个代表性的抽象推理能力基准,基于有限样例,其解需要一些关于对象、目标状态、计数和基础几何等概念的“核心知识”。当使用文本编码表示其二维输入输出网格时,GPT-4 仅解决了最直观的 50 个 ARC 任务中的 13 个。我们的失败分析揭示,GPT-4 识别对象并对其进行推理的能力显著受任务文本编码中表征对象的文本顺序性影响。为验证该假设,我们设计了一个新基准 1D-ARC,由一维(类数组)任务组成,更利于基于 GPT 的推理,且其表现确实优于(二维)ARC。为缓解此问题,我们提出一种通过外部工具获得的基于对象的表征,使已解 ARC 任务性能近乎翻倍,并在更简单的 1D-ARC 上接近完美分数。尽管最先进的 GPT-4 无法在非语言领域(如 1D-ARC 或简单 ARC 子集)中完美“推理”,我们的研究揭示基于对象的表征可显著提升其推理能力。可视化、GPT 日志与数据见 https://khalil-research.github.io/LLM4ARC。
引用
@article{arxiv.2305.18354,
title = {LLMs and the Abstraction and Reasoning Corpus: Successes, Failures, and the Importance of Object-based Representations},
author = {Yudong Xu and Wenhao Li and Pashootan Vaezipoor and Scott Sanner and Elias B. Khalil},
journal= {arXiv preprint arXiv:2305.18354},
year = {2024}
}
备注
26 pages, 15 figures, published in Transactions on Machine Learning Research (TMLR)