中文

Multi-LogiEval:用于评估大语言模型多步逻辑推理能力的评估基准

计算与语言 2024-10-08 v3 人工智能

摘要

随着大语言模型(LLM)在自然语言理解任务中表现出卓越的性能,迫切需要衡量其类人多步逻辑推理能力。现有的逻辑推理评估基准通常主要关注单步或有限推理规则的简单多步推理,并且缺乏评估非单调推理的数据集,因为这更贴近类人推理。为克服这些限制,我们提出了 Multi-LogiEval,一个涵盖多步逻辑推理、各种推理规则和深度的综合评估数据集。Multi-LogiEval 包含三种逻辑类型——命题逻辑、一阶逻辑和非单调逻辑,包含超过 30 条推理规则及其 60 多种组合,具有不同深度。借助该数据集,我们在 GPT-4、ChatGPT、Gemini-Pro、Yi、Orca 和 Mistral 等多种大语言模型上进行了评估,采用零样本链式思维方法。实验结果表明,随着推理步骤/深度增加,大语言模型的性能显著下降(深度为 1 时平均准确率约为 68%,深度为 5 时降至约 43%)。我们进一步对大语言模型生成的推理链进行了深入调查,发现了若干重要发现。我们认为 Multi-LogiEval 有助于推动评估和提升大语言模型逻辑推理能力的后续研究。数据可在 https://github.com/Mihir3009/Multi-LogiEval 获取。

关键词

引用

@article{arxiv.2406.17169,
  title  = {Multi-LogiEval: Towards Evaluating Multi-Step Logical Reasoning Ability of Large Language Models},
  author = {Nisarg Patel and Mohith Kulkarni and Mihir Parmar and Aashna Budhiraja and Mutsumi Nakamura and Neeraj Varshney and Chitta Baral},
  journal= {arXiv preprint arXiv:2406.17169},
  year   = {2024}
}

备注

Accepted at EMNLP 2024 Main