中文

解谜格子问题的逐步推理:LLMs会在哪些地方失败?

计算与语言 2024-10-07 v2 人工智能

摘要

解谜格子问题涉及大量逻辑推理,因此是评估模型推理能力的良好领域,可指导我们改进模型的推理能力。然而,大多数现有工作仅评估拼图的最终预测答案,未深入分析LLMs的推理链(如它们在何处失败)或提供评估这些链的更细粒度指标。由于LLMs可能依赖简单的启发式方法或数据特征来预测最终答案,因此必须超越整体正确性度量,对生成的推理链进行评估,以准确评估LLMs的推理能力。为此,我们首先开发了GridPuzzle数据集,包含274个不同复杂性的网格谜题。其次,我们提出了一种新型错误分类法,源自对GPT-4、Claude-3、Gemini、Mistral和Llama-2等LLMs推理链进行手动分析的结果。然后,我们开发了一个基于LLM的框架,用于大规模主观评估(即识别错误),以及用于评估推理链正确性的客观指标PuzzleEval。对LLMs的推理链进行评估导致了若干有趣的发现。我们进一步表明,现有用于增强模型推理能力的提示方法在GridPuzzle上并未提升性能。这一发现凸显了理解细粒度错误的重要性,为未来研究提供了挑战——即通过发展针对这些错误的方法来增强LLMs的解谜能力。数据和源代码均可在https://github.com/Mihir3009/GridPuzzle 获取。

关键词

引用

@article{arxiv.2407.14790,
  title  = {Step-by-Step Reasoning to Solve Grid Puzzles: Where do LLMs Falter?},
  author = {Nemika Tyagi and Mihir Parmar and Mohith Kulkarni and Aswin RRV and Nisarg Patel and Mutsumi Nakamura and Arindam Mitra and Chitta Baral},
  journal= {arXiv preprint arXiv:2407.14790},
  year   = {2024}
}

备注

Accepted at EMNLP 2024 Main