中文

Meta-Explore:基于场景物体谱 grounding 的探索式分层视觉与语言导航

计算机视觉与模式识别 2023-03-08 v1 人工智能 机器人学

摘要

视觉与语言导航(VLN)的主要挑战在于如何在未见过的环境中理解自然语言指令。传统 VLN 算法的主要局限在于,一旦动作出错,智能体便无法遵循指令或探索不必要的区域,从而走向不可恢复的路径。为解决此问题,我们提出 Meta-Explore,一种部署利用策略以纠正近期被误导动作的分层导航方法。我们表明,相较于将智能体移回先前访问状态的办法,将其移向未访问但可观测状态中精心选择的局部目标的利用策略表现更优。我们还强调了利用具有语义意义线索对遗憾探索进行想象的迫切需求。我们方法的关键在于在谱域中理解智能体周围物体的摆放。具体而言,我们提出一种称为场景物体谱(SOS)的新颖视觉表征,它对检测到的物体进行按类别的二维傅里叶变换。结合利用策略与 SOS 特征,智能体可通过选择有前景的局部目标来纠正其路径。我们在 R2R、SOON 和 REVERIE 三个 VLN 基准上评估了我们的方法。Meta-Explore 优于其他基线并展现出显著的泛化性能。此外,使用所提谱域 SOS 特征的局部目标搜索在 SOON 基准上将成功率显著提升 17.1%、将 SPL 显著提升 20.6%。

关键词

引用

@article{arxiv.2303.04077,
  title  = {Meta-Explore: Exploratory Hierarchical Vision-and-Language Navigation Using Scene Object Spectrum Grounding},
  author = {Minyoung Hwang and Jaeyeon Jeong and Minsoo Kim and Yoonseon Oh and Songhwai Oh},
  journal= {arXiv preprint arXiv:2303.04077},
  year   = {2023}
}

备注

Accepted by CVPR 2023. Project page: https://rllab-snu.github.io/projects/Meta-Explore/doc.html