提升大语言模型的空间推理能力:基于StepGame基准的深入评估与增强
人工智能
2024-01-11 v1 计算与语言
数据库
计算机科学中的逻辑
摘要
人工智能(AI)在各个领域取得了显著进展,像ChatGPT这样的大语言模型因其类人的文本生成能力而备受关注。尽管取得了这些成就,空间推理对这些模型而言仍是一项重大挑战。诸如StepGame之类的基准测试用于评估AI的空间推理能力,而ChatGPT在此基准上表现不佳。然而,该基准中存在的模板错误对评估结果产生了影响。因此,如果这些模板错误得到修正,ChatGPT有可能表现得更好,从而对其空间推理能力进行更准确的评估。在本研究中,我们优化了StepGame基准,为模型评估提供了一个更精确的数据集。我们分析了GPT在修正后基准上的空间推理性能,发现其在将自然语言文本映射到空间关系方面表现熟练,但在多跳推理上存在局限。我们通过将模板到关系的映射与基于逻辑的推理相结合,为该基准提供了一个完美无误的解决方案。这一结合展示了在StepGame上进行定性推理且不遇到任何错误的能力。随后,我们着手解决GPT模型在空间推理方面的局限性。我们部署了思维链和思维树提示策略,深入洞察了GPT的“认知过程”,并在准确性上取得了显著提升。我们的研究不仅揭示了模型的缺陷,还提出了增强方案,为推进AI具备更强大的空间推理能力做出了贡献。
引用
@article{arxiv.2401.03991,
title = {Advancing Spatial Reasoning in Large Language Models: An In-Depth Evaluation and Enhancement Using the StepGame Benchmark},
author = {Fangjun Li and David C. Hogg and Anthony G. Cohn},
journal= {arXiv preprint arXiv:2401.03991},
year = {2024}
}
备注
Camera-Ready version for AAAI 2024