SOON:基于图探索的面向场景物体导航
计算机视觉与模式识别
2021-10-18 v2
摘要
像人类一样从三维具身环境中的任意位置朝向语言引导目标导航,是智能机器人的“圣杯”目标之一。然而,大多数视觉导航基准侧重于从固定起点朝向目标导航,由逐步描述的详尽指令引导。这种方法偏离了现实世界问题,在后者中人类仅描述物体及其周围的外观,并要求机器人从任意位置开始导航。相应地,本文引入一种面向场景的物体导航(SOON)任务。在该任务中,智能体需从三维具身环境中的任意位置出发,依据场景描述导航以定位目标。为给出解决该任务的有前景方向,我们提出一种新颖的基于图的探索(GBE)方法,将导航状态建模为图,并引入一种新颖的基于图的探索方法来从图中学习知识,并通过学习次优轨迹稳定训练。我们还提出一个名为“从任意位置到物体”(FAO)的新大规模基准数据集。为避免目标歧义,FAO 中的描述提供丰富语义场景信息,包括:物体属性、物体关系、区域描述和邻近区域描述。我们的实验表明,所提 GBE 在 FAO 和 R2R 数据集上均优于多种最先进方法。并且 FAO 上的消融研究验证了数据集的质量。
引用
@article{arxiv.2103.17138,
title = {SOON: Scenario Oriented Object Navigation with Graph-based Exploration},
author = {Fengda Zhu and Xiwen Liang and Yi Zhu and Xiaojun Chang and Xiaodan Liang},
journal= {arXiv preprint arXiv:2103.17138},
year = {2021}
}