使用反事实任务评估大语言模型中类比推理的通用性
人工智能
2024-02-15 v1 计算与语言
摘要
大型语言模型 (LLMs) 在多个推理基准测试中表现良好,包括那些测试类比推理能力的基准。然而,它们究竟是执行类似人类的抽象推理,还是采用依赖与训练数据中已见内容相似性的、通用性较低的过程,一直存在争议。在此,我们研究了先前声称 LLMs 具备的类比能力 (Webb, Holyoak, & Lu, 2023) 的通用性。我们选取一组用于评估 LLMs 的类比问题,并创建了一组“反事实”变体——这些版本测试相同的抽象推理能力,但可能与任何预训练数据都不相似。我们测试了人类和三个 GPT 模型在原始问题和反事实问题上的表现,结果表明,虽然人类在所有问题上的表现仍然很高,但 GPT 模型在反事实问题集上的表现急剧下降。这项工作提供的证据表明,尽管先前报道 LLMs 在类比推理方面取得了成功,但这些模型缺乏人类类比推理的鲁棒性和通用性。
引用
@article{arxiv.2402.08955,
title = {Using Counterfactual Tasks to Evaluate the Generality of Analogical Reasoning in Large Language Models},
author = {Martha Lewis and Melanie Mitchell},
journal= {arXiv preprint arXiv:2402.08955},
year = {2024}
}