MANGO:评估大语言模型地图构建与导航能力的基准
计算与语言
2024-08-09 v2 人工智能
机器学习
机器人学
摘要
大型语言模型如ChatGPT和GPT-4最近在各种自然语言处理任务上取得了惊人的性能。在本文中,我们提出了MANGO,一个评估它们执行基于文本的地图构建和导航能力的基准。我们的基准包括来自一套文本游戏的53个迷宫:每个迷宫配有一个访问每个位置但不覆盖所有可能路径的遍历。任务是问答:对于每个迷宫,大语言模型读取遍历并回答数百个地图构建和导航问题,例如“如何从西屋去阁楼?”和“如果我们从地窖向北和向东走,我们在哪里?”。尽管这些问题对人类来说很容易,但事实证明,即使是迄今为止最好的语言模型GPT-4,在回答这些问题时也表现不佳。此外,我们的实验表明,强大的地图构建和导航能力将有利于大语言模型执行相关的下游任务,例如玩文本游戏。我们的MANGO基准将促进未来关于改进语言模型地图构建和导航能力的方法的研究。我们在https://mango.ttic.edu和https://github.com/oaklight/mango/上托管我们的排行榜、数据、代码和评估程序。
引用
@article{arxiv.2403.19913,
title = {MANGO: A Benchmark for Evaluating Mapping and Navigation Abilities of Large Language Models},
author = {Peng Ding and Jiading Fang and Peng Li and Kangrui Wang and Xiaochen Zhou and Mo Yu and Jing Li and Matthew R. Walter and Hongyuan Mei},
journal= {arXiv preprint arXiv:2403.19913},
year = {2024}
}
备注
COLM 2024 camera-ready