评估大语言模型在基于证据的主张验证中的推理能力
计算与语言
2025-06-18 v4
摘要
尽管大语言模型 (LLM) 在数学和编码相关的推理任务中表现出色,但其在其他形式推理方面的能力仍是一个未解之谜。在此,我们从主张验证的角度考察推理问题。我们提出了一个框架,旨在将任何 paired 的主张与证据分解为验证所需的原子推理类型。利用该框架,我们创建了 RECV,这是首个结合真实世界主张的主张验证基准,用于评估 LLM 的演绎和溯因推理能力。该基准包含三个数据集,涵盖复杂度递增的推理问题。我们在多种提示设置下评估了三种最先进的专有 LLM。结果表明,虽然 LLM 能够解决演绎推理问题,但在溯因推理案例中却 consistently 失败。此外,我们观察到为 LLM 增强理由生成并不总是有益的。尽管如此,我们发现生成的理由与人类提供的理由在语义上相似,特别是在演绎推理案例中。
引用
@article{arxiv.2402.10735,
title = {Assessing the Reasoning Capabilities of LLMs in the context of Evidence-based Claim Verification},
author = {John Dougrez-Lewis and Mahmud Elahi Akhter and Federico Ruggeri and Sebastian Löbbers and Yulan He and Maria Liakata},
journal= {arXiv preprint arXiv:2402.10735},
year = {2025}
}
备注
First two authors contributed equally to this work. 25 pages, 3 figure