What is an "Abstract Reasoner"? Revisiting Experiments and Arguments about Large Language Models
计算与语言
2025-07-31 v1 人工智能
摘要
近期研究认为大型语言模型(Large Language Model, LLM)不是“抽象推理者”,因其在多项挑战性任务上的零样本性能表现不佳而得出结论。我们重新审视这些实验,以增添论点的细微差别。首先,我们表明尽管LLMs在零样本设置下确实表现较差,即使对少量参数进行微调以进行输入编码,也可实现近乎完美的性能。然而,我们也表明,这种微调并不一定能在不同数据集之间传递。我们将这一系列实证结果视为邀请(重新)开启关于什么是“抽象推理者”的讨论,以及这为何重要的问题。
引用
@article{arxiv.2507.22457,
title = {What is an "Abstract Reasoner"? Revisiting Experiments and Arguments about Large Language Models},
author = {Tian Yun and Chen Sun and Ellie Pavlick},
journal= {arXiv preprint arXiv:2507.22457},
year = {2025}
}
备注
CONLL 2025. Project webpage: https://abstract-reasoner-llm.github.io/