声音源定位是否真的需要声音?
计算机视觉与模式识别
2020-07-14 v1 声音
音频与语音处理
摘要
在利用视觉与听觉信息进行声音源定位的任务中,目前仍不清楚图像与声音两种模态各自对结果的贡献程度,即声音源定位是否真的需要图像与声音二者?为解答该问题,我们开发了一种无监督学习系统,将声音源定位任务解耦为两步:(i) “潜在声源定位”,仅利用视觉信息定位可能的声源;(ii) “目标选择”,利用听觉信息辨识哪些物体实际在发声。我们的整体系统在声音源定位上取得了最先进的性能,更重要的是,我们发现尽管存在可用信息上的限制,步骤 (i) 的结果达到了相近的性能。基于该观察与进一步实验,我们表明在采用当前基准数据集进行评估时,视觉信息在“声音”源定位中占主导地位。此外,我们表明该数据集中样本内大多数发声物体仅凭视觉信息即可被固有地识别,因此该数据集不足以评估系统利用听觉信息的能力。作为替代,我们提出了一种强制同时利用视觉与听觉信息的评估协议,并通过若干实验验证了该性质。
引用
@article{arxiv.2007.05722,
title = {Do We Need Sound for Sound Source Localization?},
author = {Takashi Oya and Shohei Iwase and Ryota Natsume and Takahiro Itazuri and Shugo Yamaguchi and Shigeo Morishima},
journal= {arXiv preprint arXiv:2007.05722},
year = {2020}
}
备注
Paper: 14 pages, 6 figures. Supplementary Material: 6 pages, 3 figures. Videos and Codes will be released later