MapGPT:面向视觉语言导航的地图引导提示与自适应路径规划
人工智能
2024-06-21 v3 计算机视觉与模式识别
机器人学
摘要
以GPT为大脑的具身智能体在各种任务中展现了非凡的决策和泛化能力。然而,现有的用于视觉语言导航(VLN)的零样本智能体仅提示GPT-4在局部环境中选择潜在位置,而没有为智能体构建有效的“全局视图”来理解整体环境。在这项工作中,我们提出了一种新颖的基于地图的GPT智能体,称为MapGPT,它引入了一种在线语言形式的地图来鼓励全局探索。具体来说,我们构建了一个在线地图,并将其融入包含节点信息和拓扑关系的提示中,以帮助GPT理解空间环境。得益于这种设计,我们进一步提出了一种自适应规划机制,帮助智能体基于地图执行多步路径规划,系统地逐步探索多个候选节点或子目标。大量实验表明,我们的MapGPT同时适用于GPT-4和GPT-4V,在R2R和REVERIE上同时实现了最先进的零样本性能(SR分别提升约10%和约12%),并展示了GPT新出现的全局思维和路径规划能力。
引用
@article{arxiv.2401.07314,
title = {MapGPT: Map-Guided Prompting with Adaptive Path Planning for Vision-and-Language Navigation},
author = {Jiaqi Chen and Bingqian Lin and Ran Xu and Zhenhua Chai and Xiaodan Liang and Kwan-Yee K. Wong},
journal= {arXiv preprint arXiv:2401.07314},
year = {2024}
}
备注
LLM/VLM-based VLN Agents. Accepted to ACL 2024. Project: https://chen-judge.github.io/MapGPT/