实例特定图像目标导航:训练具身智能体寻找物体实例
计算机视觉与模式识别
2022-11-30 v1
摘要
我们考虑给定图像目标 (ImageNav) 的具身视觉导航问题,其中智能体在不熟悉的环境中初始化,并被赋予导航至由一幅图像“描述”的位置的任务。与相关的导航任务不同,ImageNav 没有标准化的任务定义,这使得跨方法比较困难。此外,现有形式具有两个有问题特性:(1) 图像目标从随机位置采样,可能导致歧义(例如,看向墙壁);(2) 图像目标匹配智能体的相机规格与具身形态;在考虑用户驱动的下游应用时,这种刚性具有局限性。我们提出实例特定图像导航任务 (InstanceImageNav) 以解决这些局限。具体而言,目标图像“聚焦”于场景中某个特定物体实例,并以独立于智能体的相机参数拍摄。我们在 Habitat 模拟器中使用来自 Habitat-Matterport3D 数据集 (HM3D) 的场景实例化 InstanceImageNav,并发布一个标准化基准以衡量社区进展。
引用
@article{arxiv.2211.15876,
title = {Instance-Specific Image Goal Navigation: Training Embodied Agents to Find Object Instances},
author = {Jacob Krantz and Stefan Lee and Jitendra Malik and Dhruv Batra and Devendra Singh Chaplot},
journal= {arXiv preprint arXiv:2211.15876},
year = {2022}
}