大型语言模型在空间任务上的评估:多任务基准测试研究
计算与语言
2025-01-06 v4 计算机与社会
摘要
大型语言模型如 ChatGPT、Gemini 等的出现凸显了评估其多样化能力的重要性,涵盖从自然语言理解到代码生成等各方面。然而,这些模型在空间任务上的表现尚未得到系统评估。本研究通过引入新的多任务空间评估数据集,系统性地探索和比较了几种先进模型在空间任务上的性能。该数据集包括十二种不同的任务类型,如空间理解和简单路径规划,每种任务都有经过验证和准确的答案。我们评估了多个模型,包括 OpenAI 的 gpt-3.5-turbo、gpt-4-turbo、gpt-4o、智谱 AI 的 glm-4、Anthropic 的 claude-3-sonnet-20240229 以及 MoonShot 的 moonshot-v1-8k,并采用两阶段测试方法。首先进行零样本测试。随后按难度分类数据集,进行 prompt-tuning 测试。结果表明,gpt-4o 在第一阶段实现了最高的总体准确率,平均为 71.3%。尽管 moonshot-v1-8k 总体表现略逊于人气, 但在地名识别任务中超越了 gpt-4o。本研究还凸显了 prompt strategy 对特定任务中模型性能的影响。例如,Chain-of-Thought (CoT) 策略使 gpt-4o 在简单路径规划中的准确率从 12.4% 提升至 87.5%,而单样本策略使 moonshot-v1-8k 在地图任务中的准确率从 10.1% 提升至 76.3%。
引用
@article{arxiv.2408.14438,
title = {Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study},
author = {Liuchang Xu and Shuo Zhao and Qingming Lin and Luyao Chen and Qianqian Luo and Sensen Wu and Xinyue Ye and Hailin Feng and Zhenhong Du},
journal= {arXiv preprint arXiv:2408.14438},
year = {2025}
}