利用声音方向图的多目标视听导航
计算机视觉与模式识别
2023-08-02 v1 声音
音频与语音处理
摘要
过去几年中,利用深度强化学习智能体研究室内环境导航任务的工作大量涌现。多数此类任务仅使用第一人称图像形式的视觉信息导航至单一目标。近来,同时利用视觉与听觉信息导航至声源、甚至包含多个而非一个目标点的导航任务已被提出。然而,在多个声源即为目标的情况下,尚未有结合这两类任务并同时使用视觉与听觉信息的通用导航任务提案。本文针对这一通用任务提出新框架:多目标视听导航。我们首先详细定义该任务,随后通过在多种情境下开展实验,探究多目标视听导航任务相对于当前导航任务的难度。研究表明,多目标视听导航存在需隐式分离声源这一难点。接下来,为缓解该新任务的困难,我们提出一种称为声音方向图(SDM)的方法,其以基于学习的方式动态定位多个声源并利用过往记忆。实验结果表明,无论目标数量多少,使用 SDM 均能显著提升多种基线方法的性能。
引用
@article{arxiv.2308.00219,
title = {Multi-goal Audio-visual Navigation using Sound Direction Map},
author = {Haru Kondoh and Asako Kanezaki},
journal= {arXiv preprint arXiv:2308.00219},
year = {2023}
}
备注
IROS2023