中文

动态视听导航:在未知 3D 环境中捕捉未听闻的运动声源

计算机视觉与模式识别 2022-01-13 v1 机器学习 机器人学 声音 音频与语音处理

摘要

近期视听导航工作针对无噪声音频环境中的单一静态声源,且难以泛化到未听闻的声音。我们引入新颖的动态视听导航基准,其中具身 AI 智能体必须在存在干扰项与噪声声源的无地图环境中捕捉运动声源。我们提出一种端到端强化学习方法,依赖多模态架构融合来自双耳音频信号与空间占据图的空间视听信息,以编码学习新复杂任务设定下稳健导航策略所需特征。我们证明,在静态与动态视听导航基准上,我们的方法在 Replica 与 Matterport3D 两个具挑战性的 3D 扫描真实世界数据集中,对未听闻声音具有更好泛化性,对噪声场景具有更好鲁棒性,优于当前最优方法。我们的新基准将发布于 http://dav-nav.cs.uni-freiburg.de。

关键词

引用

@article{arxiv.2201.04279,
  title  = {Dynamical Audio-Visual Navigation: Catching Unheard Moving Sound Sources in Unmapped 3D Environments},
  author = {Abdelrahman Younes},
  journal= {arXiv preprint arXiv:2201.04279},
  year   = {2022}
}