LogicBench:面向大型语言模型逻辑推理能力系统评估
计算与语言
2024-06-07 v2 人工智能
摘要
最近发展的大型语言模型(LLMs)在广泛的语言理解任务上表现出色。但它们是否能够真正“推理”自然语言仍是亟待解答的问题。这一问题正受到广泛关注,许多推理技能,如常识推理、数值推理和定性推理都已受到研究。然而,涉及‘逻辑推理’的关键技能仍未得到充分探索。现有研究仅聚焦于命题逻辑和一阶逻辑中的少数推理规则(如肯定前提和否定后题)。针对上述局限,本文综合评估了大型语言模型在25种不同的推理模式上的表现,这些模式涵盖命题逻辑、一阶逻辑和非单调逻辑。为实现系统评估,我们引入 LogicBench—a 聚焦于单一推理规则的自然语言问答数据集。我们使用链式思维提示,对 GPT-4、ChatGPT、Gemini、Llama-2 和 Mistral 等多种大型语言模型进行了详细分析。实验结果表明,现有大型语言模型在 LogicBench 上表现不佳;尤其是它们在涉及复杂推理和否定情况的实例上仍显吃力。此外,它们有时会忽略推理得出正确结论所必需的上下文信息。我们认为,本工作及其发现为评估和提升大型语言模型的逻辑推理能力提供了未来的研究方向。数据和代码已公开(https://github.com/Mihir3009/LogicBench)。
关键词
引用
@article{arxiv.2404.15522,
title = {LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models},
author = {Mihir Parmar and Nisarg Patel and Neeraj Varshney and Mutsumi Nakamura and Man Luo and Santosh Mashetty and Arindam Mitra and Chitta Baral},
journal= {arXiv preprint arXiv:2404.15522},
year = {2024}
}
备注
Accepted at ACL(Main) 2024 | First version available @ https://openreview.net/forum?id=7NR2ZVzZxx