中文

MLLM-Search:使用多模态大语言模型进行零样本人员搜索

机器人学 2024-12-03 v1 人工智能 机器学习

摘要

在以人为中心的环境(包括医疗保健环境)中进行机器人人员搜索具有挑战性,因为自主机器人需要在没有或仅有部分关于人员日程、计划或位置的先验知识的情况下定位人员。此外,机器人需要适应可能影响人员计划的实时事件。在本文中,我们提出了MLLM-Search,一种新颖的零样本人员搜索方法,利用多模态大语言模型(MLLM)来解决在具有不同用户日程的事件驱动场景下移动机器人搜索人员的问题。我们的方法引入了一种新颖的视觉提示方法,通过生成代表可导航航点的拓扑图和语义标签的航点地图,为机器人提供环境的空间理解。这被整合到一个MLLM中,该MLLM包含一个区域规划器,根据与搜索场景的语义相关性选择下一个搜索区域,以及一个航点规划器,通过我们独特的空间思维链提示方法,考虑语义相关的对象和局部空间上下文来生成搜索路径。我们进行了广泛的逼真实验,以验证MLLM-Search在不同环境中搜索具有变化日程的人员的性能。还进行了消融研究以验证MLLM-Search的主要设计选择。此外,与最先进搜索方法的比较研究表明,MLLM-Search在搜索效率方面优于现有方法。在建筑多层楼内使用移动机器人进行的真实世界实验表明,MLLM-Search能够泛化到未见过的环境中寻找人员。

关键词

引用

@article{arxiv.2412.00103,
  title  = {MLLM-Search: A Zero-Shot Approach to Finding People using Multimodal Large Language Models},
  author = {Angus Fung and Aaron Hao Tan and Haitong Wang and Beno Benhabib and Goldie Nejat},
  journal= {arXiv preprint arXiv:2412.00103},
  year   = {2024}
}