中文

用于语义视听具身导航的知识驱动场景先验

机器人学 2022-12-23 v1 人工智能 计算机视觉与模式识别

摘要

对未见情境的泛化仍然是具身导航智能体面临的一项挑战。在语义视听导航 (SAVi) 任务的背景下,泛化的概念应包括对未见室内视觉场景的泛化以及对未听发声物体的泛化。然而,以往的 SAVi 任务定义未包含对真正新颖发声物体的评估条件,而是转而在已知物体的未听声音片段上评估智能体;同时,以往的 SAVi 方法未包含用于整合关于物体和区域语义领域知识的显式机制。这些弱点限制了模型泛化其习得经验的能力评估与发展。在本工作中,我们在语义视听具身导航任务中引入了知识驱动场景先验的使用:我们将来自编码物体-区域关系的新型知识图谱的语义信息、来自双图编码器网络的空间知识,以及来自一系列预训练任务的背景知识相结合——所有这些都在用于视听导航的强化学习框架内。我们还定义了一个新的视听导航子任务,在该子任务中,智能体在新颖发声物体上进行评估,而非已知物体的未听片段。我们展示了在 Habitat-Matterport3D 仿真环境中 SoundSpaces 任务下,相较于强基线在泛化到未见区域和新颖发声物体方面的改进。

关键词

引用

@article{arxiv.2212.11345,
  title  = {Knowledge-driven Scene Priors for Semantic Audio-Visual Embodied Navigation},
  author = {Gyan Tatiya and Jonathan Francis and Luca Bondi and Ingrid Navarro and Eric Nyberg and Jivko Sinapov and Jean Oh},
  journal= {arXiv preprint arXiv:2212.11345},
  year   = {2022}
}

备注

19 pages, 8 figures, 9 tables