VELMA:面向街景视觉与语言导航的LLM智能体语言化具身
人工智能
2024-01-25 v2 计算与语言
计算机视觉与模式识别
摘要
真实世界环境中的增量决策是具身人工智能最具挑战性的任务之一。一个尤其苛刻的场景是视觉与语言导航(VLN),其需要视觉与自然语言理解以及空间和时间推理能力。具身智能体需要将其对导航指令的理解立足于真实世界环境(如街景)的观测中。尽管LLM在其他研究领域中取得了令人印象深刻的成果,如何最好地将它们与交互式视觉环境连接仍是一个待解问题。在本工作中,我们提出VELMA,一个具身LLM智能体,其利用轨迹与视觉环境观测的语言化作为下一步动作的上下文提示。视觉信息由一条流水线语言化:该流水线从人工撰写的导航指令中提取地标,并使用CLIP确定其在当前全景视图中的可见性。我们展示VELMA仅借助两个上下文示例便能在街景中成功遵循导航指令。我们进一步在数千个示例上微调该LLM智能体,并在两个数据集上相较先前最优水平实现了25%–30%的任务完成率相对提升。
引用
@article{arxiv.2307.06082,
title = {VELMA: Verbalization Embodiment of LLM Agents for Vision and Language Navigation in Street View},
author = {Raphael Schumann and Wanrong Zhu and Weixi Feng and Tsu-Jui Fu and Stefan Riezler and William Yang Wang},
journal= {arXiv preprint arXiv:2307.06082},
year = {2024}
}
备注
Accepted at AAAI 2024