中文

评估大语言模型的逻辑谜题求解能力:来自扫雷案例研究的见解

计算与语言 2024-11-08 v2

摘要

大语言模型(LLMs)已展现出卓越的语言理解能力,并通过任务特定微调或提示工程成功应用于多种现实世界任务。尽管有这些进展,LLM 是否从根本上具备推理与规划能力,还是主要依赖从训练数据中回忆与综合信息,仍是一个开放问题。在我们的研究中,我们引入了一项新颖任务——扫雷(Minesweeper)——其格式对 LLM 而言陌生且未出现于其训练数据集中。该任务挑战 LLM 根据相邻已打开格子提供的数字线索识别地雷位置。成功完成此任务需要理解每个格子的状态、辨别线索与地雷之间的空间关系,并基于由格子排布得出的逻辑推演来策略性地行动。我们的实验(包括使用先进的 GPT-4 模型)表明,尽管 LLM 具备完成该任务所需的基础能力,但它们难以将这些能力整合为求解扫雷所需的连贯多步逻辑推理过程。这些发现凸显了进一步研究的必要,以理解类似情形下 LLM 推理能力的本质,并探索通向更精细 AI 推理与规划模型的路径。

关键词

引用

@article{arxiv.2311.07387,
  title  = {Assessing Logical Puzzle Solving in Large Language Models: Insights from a Minesweeper Case Study},
  author = {Yinghao Li and Haorui Wang and Chao Zhang},
  journal= {arXiv preprint arXiv:2311.07387},
  year   = {2024}
}

备注

23 pages, 5 figures, 4 tables, in NAACL 2024