中文

基于概率空间建模的自监督神经视听声源定位

声音 2020-07-29 v1 计算机视觉与模式识别 音频与语音处理

摘要

在视觉观测中检测声源物体对自主机器人理解周围环境十分重要。由于生活环境中发声物体种类繁多、外观各异,实践中无法对所有发声物体进行标注。这需要无需人工标注的自监督学习。大多数传统自监督学习使用单声道音频信号与图像,因音频信号空间信息匮乏,难以区分外观相似的声源物体。为解决该问题,本文提出一种使用360{\deg}图像与多通道音频信号的自监督训练方法。通过结合多通道音频信号中的空间信息,我们的方法训练深度神经网络(DNNs)以区分多个声源物体。我们用于图像中声源物体定位的系统由音频与视觉DNN组成。视觉DNN被训练以定位输入图像中的声源候选;音频DNN验证各候选是否真正发声。这些DNN基于概率空间音频模型以自监督方式联合训练。在仿真数据上的实验结果表明,经本方法训练的DNN可定位多名说话人。我们还展示视觉DNN能从科学博物馆记录的真实数据中检测出包括交谈访客与特定展品在内的物体。

关键词

引用

@article{arxiv.2007.13976,
  title  = {Self-supervised Neural Audio-Visual Sound Source Localization via Probabilistic Spatial Modeling},
  author = {Yoshiki Masuyama and Yoshiaki Bando and Kohei Yatabe and Yoko Sasaki and Masaki Onishi and Yasuhiro Oikawa},
  journal= {arXiv preprint arXiv:2007.13976},
  year   = {2020}
}

备注

Accepted for publication in 2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)