中文

LOC-ZSON:语言驱动的以对象为中心的零样本物体检索与导航

计算机视觉与模式识别 2024-05-10 v1 机器人学

摘要

在本文中,我们提出了 LOC-ZSON,一种用于复杂场景中物体导航任务的、新颖的语言驱动的以对象为中心的图像表示。我们提出了一种以对象为中心的图像表示及相应的损失函数,用于视觉-语言模型(VLM)微调,以处理复杂的对象级查询。此外,我们设计了一种新颖的基于 LLM 的增强和提示模板,以确保训练和零样本推理期间的稳定性。我们在 Astro 机器人上实现了我们的方法,并将其部署在模拟和真实世界环境中进行零样本物体导航。我们表明,在检索任务的不同基准设置下,我们提出的方法在文本到图像召回率方面可以实现 1.38% 至 13.38% 的提升。对于物体导航,我们在模拟和真实世界中展示了我们方法的优势,导航成功率分别提升了 5% 和 16.67%。

关键词

引用

@article{arxiv.2405.05363,
  title  = {LOC-ZSON: Language-driven Object-Centric Zero-Shot Object Retrieval and Navigation},
  author = {Tianrui Guan and Yurou Yang and Harry Cheng and Muyuan Lin and Richard Kim and Rajasimman Madhivanan and Arnie Sen and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2405.05363},
  year   = {2024}
}

备注

Accepted to ICRA 2024