MC-GPT:利用记忆图和推理链赋能视觉语言导航
人工智能
2024-08-13 v2 计算与语言
计算机视觉与模式识别
摘要
在视觉语言导航 (VLN) 任务中,agent 需要跟随自然语言指令导航至目标地点。虽然基于学习的方法是该任务的主要解决方案,但它们存在高训练成本和缺乏可解释性的问题。最近,大语言模型 (LLM) 因其强大的泛化能力而成为 VLN 的热门工具。然而,现有的 LLM-based 方法在记忆构建和导航策略多样性方面存在局限。为此,我们提出了一套技术措施。首先,我们引入一种方法来维护存储导航历史的拓扑地图,保留关于视点、物体及其空间关系的信息。该地图还作为全局动作空间。此外,我们提出了 Navigation Chain of Thoughts 模块,利用人类导航示例丰富导航策略的多样性。最后,我们建立了一个将 navigational memory 和 strategies 与 perception 和 action prediction 模块集成的 pipeline。在 REVERIE 和 R2R 数据集上的实验结果表明,我们的方法有效提升了 LLM 的导航能力,并增强了导航推理的可解释性。
引用
@article{arxiv.2405.10620,
title = {MC-GPT: Empowering Vision-and-Language Navigation with Memory Map and Reasoning Chains},
author = {Zhaohuan Zhan and Lisha Yu and Sijie Yu and Guang Tan},
journal= {arXiv preprint arXiv:2405.10620},
year = {2024}
}