中文

Navi2Gaze:利用基础模型实现导航与目标凝视

机器人学 2024-09-18 v2

摘要

任务导向导航始终是具有挑战性的研究领域,尤其是在涉及开放词汇的场景中。以往研究主要关注找到完成任务的合适位置,往往忽视了机器人姿态的重要性。然而,机器人的姿态对于成功完成任务至关重要,因为物体的摆放方式决定了这种情况(例如,打开冰箱时)。人类会直观地导航至具有正确姿态的目标位置,使用语义和常识。例如,打开冰箱时,我们自然会站在它前面而非侧面。近期进展表明,视觉语言模型(VLM)能为机器人提供类似的常识。因此,我们开发了一种基于VLM的方法,称为Navigation-to-Gaze(Navi2Gaze),用于高效导航和目标凝视。该方法利用VLM自动为众多候选位置打分并选择最佳位置。在多个逼真模拟基准测试中,Navi2Gaze显著优于现有方法,精准确定相对于目标对象的最佳姿态,使距离目标(Distance to Goal, DTG)降低68.8%。实物视频演示可在补充网站找到。

关键词

引用

@article{arxiv.2407.09053,
  title  = {Navi2Gaze: Leveraging Foundation Models for Navigation and Target Gazing},
  author = {Jun Zhu and Zihao Du and Haotian Xu and Fengbo Lan and Zilong Zheng and Bo Ma and Shengjie Wang and Tao Zhang},
  journal= {arXiv preprint arXiv:2407.09053},
  year   = {2024}
}