人类与大语言模型在演绎推理中的推理策略比较
计算与语言
2024-06-04 v2 人工智能
摘要
演绎推理在构建严密且连贯的论证方面发挥着关键作用。它允许个体在给定信息的真值基础上,得出逻辑推导的结论。近年来,大语言模型(LLMs)在演绎推理任务方面的能力取得了显著进展。然而,大量研究主要评估LLMs在解决此类任务时的准确性,却忽略了对其推理行为的深入分析。本研究运用认知心理学的原理,通过对LLMs对命题逻辑问题的响应进行详细评估,来检视其采用的推理策略。我们的发现表明,LLMs呈现出类似于人类的推理模式,包括“跟随假设”或“链式构建”等策略。此外,本研究显示,模型的架构和规模显著影响其首选的推理方法,更高级的模型倾向于比较粗糙的模型更频繁地采用这些策略。重要的是,我们主张,模型的准确性——即其最终结论的正确性——不一定反映其推理过程的有效性。这一区分凸显了该领域需要更细致的评估程序的必要性。
引用
@article{arxiv.2402.14856,
title = {Comparing Inferential Strategies of Humans and Large Language Models in Deductive Reasoning},
author = {Philipp Mondorf and Barbara Plank},
journal= {arXiv preprint arXiv:2402.14856},
year = {2024}
}
备注
ACL 2024 main, 31 pages, 19 figures