大型语言模型能否进行简单算术推理?对蕴含算术关系的探针研究
计算与语言
2024-05-01 v1 人工智能
摘要
在大语言模型时代,两个主要关注领域涉及LLM知道什么,以及它们是否以及如何能够推理(或更准确地说,近似推理)。由于迄今为止这些研究方向在很大程度上是并行推进的(尽管有显著例外),我们有兴趣探究其交叉点:对隐含知识的推理进行探针。我们怀疑该领域的性能存在不足,因此使用一个非常简单的设置:比较不同主题相关基数的数量(例如,鸟的腿数与三轮车的轮子数)。我们通过实验证明,尽管LLM在每次新的GPT发布中在知识获取和(伪)推理方面稳步进步,但其能力仅限于统计推断。很难论证纯粹的统计学习能够应对许多常识推理任务中固有的组合爆炸,尤其是涉及算术概念时。此外,我们认为更大并不总是更好,追求纯粹的统计改进在核心上是有缺陷的,因为它只会加剧将正确答案的产生与真正推理能力混为一谈的危险。
引用
@article{arxiv.2404.19432,
title = {Can Large Language Models put 2 and 2 together? Probing for Entailed Arithmetical Relationships},
author = {D. Panas and S. Seth and V. Belle},
journal= {arXiv preprint arXiv:2404.19432},
year = {2024}
}