Navi2Gaze:利用基础模型实现导航与目标凝视
机器人学
2024-09-18 v2
摘要
任务导向导航始终是具有挑战性的研究领域,尤其是在涉及开放词汇的场景中。以往研究主要关注找到完成任务的合适位置,往往忽视了机器人姿态的重要性。然而,机器人的姿态对于成功完成任务至关重要,因为物体的摆放方式决定了这种情况(例如,打开冰箱时)。人类会直观地导航至具有正确姿态的目标位置,使用语义和常识。例如,打开冰箱时,我们自然会站在它前面而非侧面。近期进展表明,视觉语言模型(VLM)能为机器人提供类似的常识。因此,我们开发了一种基于VLM的方法,称为Navigation-to-Gaze(Navi2Gaze),用于高效导航和目标凝视。该方法利用VLM自动为众多候选位置打分并选择最佳位置。在多个逼真模拟基准测试中,Navi2Gaze显著优于现有方法,精准确定相对于目标对象的最佳姿态,使距离目标(Distance to Goal, DTG)降低68.8%。实物视频演示可在补充网站找到。
引用
@article{arxiv.2407.09053,
title = {Navi2Gaze: Leveraging Foundation Models for Navigation and Target Gazing},
author = {Jun Zhu and Zihao Du and Haotian Xu and Fengbo Lan and Zilong Zheng and Bo Ma and Shengjie Wang and Tao Zhang},
journal= {arXiv preprint arXiv:2407.09053},
year = {2024}
}