VLPG-Nav:使用视觉语言姿态图和物体定位概率图的物体导航
机器人学
2024-08-16 v1
摘要
我们提出了VLPG-Nav,一种用于引导机器人在室内场景中定位指定物体的视觉语言导航方法。与现有主要关注将机器人导航至物体的方法不同,我们的方法考虑了将物体居中于机器人相机视野中的额外挑战。我们的方法构建了一个视觉语言姿态图(VLPG),它作为VL嵌入的空间地图。给定一个开放词汇的物体查询,我们利用VLPG规划物体导航的视角。然而,尽管导航至该视角,真实世界的挑战如物体遮挡、位移和机器人定位误差可能阻碍可见性。我们构建了一个物体定位概率图,利用机器人的当前观测和先验VLPG。当物体不可见时,概率图被更新并计算备用视角。此外,我们提出了一种物体居中公式,用于局部调整机器人姿态以将物体居中在相机视野中。我们通过仿真和真实实验评估了我们方法的有效性,评估其成功查看并将物体居中在相机视野中的能力。VLPG-Nav在定位物体、绕过遮挡以及将物体居中于机器人相机视野方面表现出优于所选基线的性能。
引用
@article{arxiv.2408.08301,
title = {VLPG-Nav: Object Navigation Using Visual Language Pose Graph and Object Localization Probability Maps},
author = {Senthil Hariharan Arul and Dhruva Kumar and Vivek Sugirtharaj and Richard Kim and Xuewei and Qi and Rajasimman Madhivanan and Arnie Sen and Dinesh Manocha},
journal= {arXiv preprint arXiv:2408.08301},
year = {2024}
}