追踪大语言模型中人类式推理的ongoing emergence
计算与语言
2026-05-21 v1 人工智能
摘要
人类轻松地超越字面意义:若你割草,我会给你五十美元,通常被理解为只有在草被割草后才会支付给言语者;而若你饿了,烤箱里有披萨,则意味着披萨可用而不取决于听者是否饿。大语言模型(LLM)在许多任务上表现出人类水平,但是否以人类方式进行推理仍不明确。为此,我们进行了与人类数量匹配的实验,评估二十五个LLM在四种语言中计算条件推断的方式,并与每种语言等量的人类进行比较。我们发现,人类通过修辞推断丰富逻辑推理。模型行为更为多变。一些LLM完美遵循条件的真值表,但忽略修辞推断;而另一些LLM则偏离真值表,贯彻单一解释,反映出准确的基于规则的处理,但不具备人类式推理。总体而言,LLM是准确的语义算子,但未能捕捉人类推理所特有的修辞丰富性。关键的是,LLM的准确性既不被预测,也未因开放式/封闭式、训练方向或模型架构类型所提升,表明修辞推理仍是人工系统认知工具集中正在出现的能力。
引用
@article{arxiv.2605.21299,
title = {Tracing the ongoing emergence of human-like reasoning in Large Language Models},
author = {Paolo Morosi and Nikoleta Pantelidou and Fritz Günther and Elena Pagliarini and Evelina Leivada},
journal= {arXiv preprint arXiv:2605.21299},
year = {2026}
}