LOC-ZSON:语言驱动的以对象为中心的零样本物体检索与导航
计算机视觉与模式识别
2024-05-10 v1 机器人学
摘要
在本文中,我们提出了 LOC-ZSON,一种用于复杂场景中物体导航任务的、新颖的语言驱动的以对象为中心的图像表示。我们提出了一种以对象为中心的图像表示及相应的损失函数,用于视觉-语言模型(VLM)微调,以处理复杂的对象级查询。此外,我们设计了一种新颖的基于 LLM 的增强和提示模板,以确保训练和零样本推理期间的稳定性。我们在 Astro 机器人上实现了我们的方法,并将其部署在模拟和真实世界环境中进行零样本物体导航。我们表明,在检索任务的不同基准设置下,我们提出的方法在文本到图像召回率方面可以实现 1.38% 至 13.38% 的提升。对于物体导航,我们在模拟和真实世界中展示了我们方法的优势,导航成功率分别提升了 5% 和 16.67%。
引用
@article{arxiv.2405.05363,
title = {LOC-ZSON: Language-driven Object-Centric Zero-Shot Object Retrieval and Navigation},
author = {Tianrui Guan and Yurou Yang and Harry Cheng and Muyuan Lin and Richard Kim and Rajasimman Madhivanan and Arnie Sen and Dinesh Manocha},
journal= {arXiv preprint arXiv:2405.05363},
year = {2024}
}
备注
Accepted to ICRA 2024