零样本物体中心指令跟随:将基础模型与传统导航相结合
机器人学
2025-05-09 v3 计算机视觉与模式识别
摘要
大型场景(如多层住宅)可以通过在因子图中与机器人位姿联合估计的 3D 地标图进行鲁棒且高效的建图,这是无人机和机器人吸尘器等商用机器人中常用的一种技术。在这项工作中,我们提出了语言推断因子图指令跟随 (LIFGIF),这是一种在此类地图中落地自然语言指令的零样本方法。LIFGIF 还包含一个策略,用于在构建地图的同时在新环境中遵循自然语言导航指令,从而在物理世界中实现鲁棒的导航性能。为了评估 LIFGIF,我们提出了一个新的数据集,即物体中心视觉语言导航 (OC-VLN),以评估以物体为中心的自然语言导航指令的落地情况。我们与来自相关任务(物体目标导航和视觉语言导航)的两个最先进的零样本基线进行了比较,证明 LIFGIF 在 OC-VLN 的所有评估指标上均优于它们。最后,我们在波士顿动力 Spot 机器人上成功展示了 LIFGIF 在真实世界中执行零样本物体中心指令跟随的有效性。
引用
@article{arxiv.2411.07848,
title = {Zero-shot Object-Centric Instruction Following: Integrating Foundation Models with Traditional Navigation},
author = {Sonia Raychaudhuri and Duy Ta and Katrina Ashton and Angel X. Chang and Jiuguang Wang and Bernadette Bucher},
journal= {arXiv preprint arXiv:2411.07848},
year = {2025}
}