PLUGH:面向大语言模型的空间理解与推理基准
计算与语言
2024-08-12 v1 人工智能
信息检索
摘要
我们提出了 PLUGH(https://www.urbandictionary.com/define.php?term=plugh),一个现代基准测试,目前包含 5 个任务,每个任务包含 125 条输入文本,摘录自 48 个不同的游戏,代表 61 个不同的(非同构)空间图,用于评估大语言模型(LLM)在空间理解与推理方面的能力。我们对 API-based 和开源 LLM 进行评估,发现虽然一些商业 LLM 表现出强大的推理能力,但开源方案也能展现接近的水平;然而所有模型仍有显著提升空间。我们指出 LLM 失败的典型原因并讨论可能的应对方法。数据集和评估代码已发布(https://github.com/altsoph/PLUGH)。
引用
@article{arxiv.2408.04648,
title = {PLUGH: A Benchmark for Spatial Understanding and Reasoning in Large Language Models},
author = {Alexey Tikhonov},
journal= {arXiv preprint arXiv:2408.04648},
year = {2024}
}
备注
Wordplay Workshop @ ACL 2024