中文

迷失于逻辑:大语言模型在LSAT逻辑游戏推理能力评估

计算与语言 2024-10-01 v1 人工智能

摘要

在本文中,我评估了大语言模型(LLM)在法学院入学考试(LSAT)中的表现,特别是测试中的逻辑游戏部分。我关注这一部分是因为它提出了复杂的逻辑推理任务,因此是评估现代、能力不断增强的LLM如何处理困难逻辑推理任务的宝贵数据源。我构建了一个包含LSAT逻辑游戏及其相关元数据的数据集,并在思维链提示设置下广泛评估了LLM的性能。鉴于在该设置下的表现较弱,我在数据集的一个较小子集上探索了其他提示框架,将Reflexion的思想适配于此任务。这使得GPT-4和GPT-3.5在该数据子集上的准确率分别大幅提升至70%和46%,突显了LLM纠正其逻辑错误的能力,尽管其初始表现较弱。最后,我分析了模型表现较好或较差的逻辑游戏类型,以及通过人工标注观察到的逻辑错误类型,为LLM的逻辑推理能力提供了详细见解。

关键词

引用

@article{arxiv.2409.19012,
  title  = {Lost in the Logic: An Evaluation of Large Language Models' Reasoning Capabilities on LSAT Logic Games},
  author = {Saumya Malik},
  journal= {arXiv preprint arXiv:2409.19012},
  year   = {2024}
}

备注

Bachelor's thesis. Dataset available on huggingface: https://huggingface.co/datasets/saumyamalik/lsat_logic_games-analytical_reasoning