面向可泛化视听导航的语义无关与空间感知表示学习
机器人学
2023-06-22 v2
摘要
视听导航(VAN)因其在家庭机器人和救援机器人等方面的广泛应用,正吸引机器人学界越来越多的关注。在该任务中,具身智能体必须利用以自我为中心的视觉与音频观测搜寻并导航至声源。然而,现有方法受限于两方面:1)对未听过声音类别的泛化能力差;2)训练样本效率低。针对这两个问题,我们提出一种受大脑启发的即插即用方法,以学习用于可泛化视听导航的语义无关与空间感知表示。我们精心设计了两个辅助任务,分别用于加速学习具有上述期望特性的表示。借助这两个辅助任务,智能体学到视觉与音频输入的空间相关表示,可应用于具有新颖声音与地图的环境。在真实三维场景(Replica与Matterport3D)上的实验结果表明,当零样本迁移至含未见地图与未听声音类别的场景时,我们的方法取得了更好的泛化性能。
引用
@article{arxiv.2304.10773,
title = {Learning Semantic-Agnostic and Spatial-Aware Representation for Generalizable Visual-Audio Navigation},
author = {Hongcheng Wang and Yuxuan Wang and Fangwei Zhong and Mingdong Wu and Jianwei Zhang and Yizhou Wang and Hao Dong},
journal= {arXiv preprint arXiv:2304.10773},
year = {2023}
}