说出来你在哪里:多模态大语言模型与位置识别
计算机视觉与模式识别
2024-06-26 v1 机器人学
摘要
大语言模型(LLM)在机器人领域展现出多种有前景的能力,包括长期计划和常识推理。然而,其在位置识别方面的表现仍未得到充分探索。本文将多模态大语言模型(MLLM)引入视觉位置识别(VPR),机器人需通过视觉观察来定位自身。我们的核心设计是使用基于视觉的检索来提出几个候选位置,然后利用基于语言的推理来仔细检查每个候选位置,以做出最终决定。具体而言,我们利用即插即用的视觉基础模型(VFM)产生的鲁棒视觉特征,获取几个候选位置。随后,我们提示MLLM以成对方式描述当前观察与每个候选之间的差异,并基于这些描述推理出最佳候选位置。我们在三个数据集上的结果表明,仅凭整合VFM的通用视觉特征与MLLM的推理能力,即可提供有效的位置识别解决方案,而无需任何针对VPR的监督训练。我们认为,本工作可以激发新的可能性,用于应用和设计基础模型,即VFM、LLM和MLLM,以增强移动机器人的定位与导航。
引用
@article{arxiv.2406.17520,
title = {Tell Me Where You Are: Multimodal LLMs Meet Place Recognition},
author = {Zonglin Lyu and Juexiao Zhang and Mingxuan Lu and Yiming Li and Chen Feng},
journal= {arXiv preprint arXiv:2406.17520},
year = {2024}
}