中文

What is an "Abstract Reasoner"? Revisiting Experiments and Arguments about Large Language Models

计算与语言 2025-07-31 v1 人工智能

摘要

近期研究认为大型语言模型(Large Language Model, LLM)不是“抽象推理者”,因其在多项挑战性任务上的零样本性能表现不佳而得出结论。我们重新审视这些实验,以增添论点的细微差别。首先,我们表明尽管LLMs在零样本设置下确实表现较差,即使对少量参数进行微调以进行输入编码,也可实现近乎完美的性能。然而,我们也表明,这种微调并不一定能在不同数据集之间传递。我们将这一系列实证结果视为邀请(重新)开启关于什么是“抽象推理者”的讨论,以及这为何重要的问题。

关键词

引用

@article{arxiv.2507.22457,
  title  = {What is an "Abstract Reasoner"? Revisiting Experiments and Arguments about Large Language Models},
  author = {Tian Yun and Chen Sun and Ellie Pavlick},
  journal= {arXiv preprint arXiv:2507.22457},
  year   = {2025}
}

备注

CONLL 2025. Project webpage: https://abstract-reasoner-llm.github.io/