ZSON:基于多模态目标嵌入的零样本物体目标导航
计算机视觉与模式识别
2023-10-16 v2 机器学习
机器人学
摘要
我们提出一种可扩展的方法来学习开放世界物体目标导航(ObjectNav)——即要求虚拟机器人(智能体)在未知环境中找到任意物体实例的任务(例如“找一个水槽”)。我们的方法完全零样本——即不需要任何类型的 ObjectNav 奖励或演示。相反,我们在图像目标导航(ImageNav)任务上训练,其中智能体寻找拍摄某张图片(即目标图像)的位置。具体而言,我们将目标图像编码到一个多模态语义嵌入空间中,从而能够在未标注的 3D 环境(例如 HM3D)中大规模训练语义目标导航(SemanticNav)智能体。训练后,SemanticNav 智能体可通过将语言目标投影到同一多模态语义嵌入空间中,被指示寻找以自由形式自然语言描述的物体(例如“水槽”、“浴室水槽”等)。因此,我们的方法实现了开放世界 ObjectNav。我们在三个 ObjectNav 数据集(Gibson、HM3D 和 MP3D)上广泛评估了我们的智能体,观察到相比现有零样本方法成功率有 4.2% - 20.0% 的绝对提升。作为参考,这些提升与 Habitat 2020 和 2021 ObjectNav 挑战赛冠军之间 5% 的成功率提升相似或更好。在开放世界设定中,我们发现我们的智能体可泛化到明确提及房间的复合指令(例如“找一个厨房水槽”)以及可推断目标房间的情况(例如“找一个水槽和一个炉灶”)。
引用
@article{arxiv.2206.12403,
title = {ZSON: Zero-Shot Object-Goal Navigation using Multimodal Goal Embeddings},
author = {Arjun Majumdar and Gunjan Aggarwal and Bhavika Devnani and Judy Hoffman and Dhruv Batra},
journal= {arXiv preprint arXiv:2206.12403},
year = {2023}
}
备注
code: https://github.com/gunagg/zson