中文

学习为视听导航设置路点

计算机视觉与模式识别 2021-02-12 v3 人工智能 机器学习 机器人学 声音

摘要

在视听导航中,智能体利用视觉与听觉智能地穿越复杂、未建图的 3D 环境,以寻找声源(如另一房间响起的电话)。现有模型以固定粒度的智能体运动学习动作,并依赖对音频观测的简单循环聚合。我们提出一种强化学习视听导航方法,具两个关键新颖要素:1)在导航策略内端到端动态设置并学习的路点(waypoints),2)提供结构化、空间锚定记录的声学记忆,记载智能体移动时所闻。两个新想法都利用了音频与视觉数据的协同以揭示未建图空间的几何。我们在两个具挑战性的真实世界 3D 场景数据集 Replica 与 Matterport3D 上展示方法。我们的模型以显著幅度改进了当前最优(SOTA),且实验揭示学习视觉、声音与空间之间的联系对视听导航至关重要。项目:http://vision.cs.utexas.edu/projects/audio_visual_waypoints。

关键词

引用

@article{arxiv.2008.09622,
  title  = {Learning to Set Waypoints for Audio-Visual Navigation},
  author = {Changan Chen and Sagnik Majumder and Ziad Al-Halah and Ruohan Gao and Santhosh Kumar Ramakrishnan and Kristen Grauman},
  journal= {arXiv preprint arXiv:2008.09622},
  year   = {2021}
}

备注

Accepted to ICLR 2021