迈向基于深度学习的端到端声源定位:从音频信号到源位置坐标
声音
2019-02-01 v1 音频与语音处理
摘要
本文提出一种基于卷积神经网络(CNN)和麦克风阵列的室内声源定位新方法。据我们所知,所提方案是首个将CNN设计为直接使用原始音频信号作为输入信息、避免手工音频特征来直接估计声源三维位置的公开工作。鉴于可用的定位数据有限,本文提出一种基于两步的训练策略。我们首先使用半合成数据训练网络,这些数据由近讲语音录音生成,并模拟从声源传播到麦克风阵列过程中信号所遭受的时延和失真。然后我们使用少量真实数据微调该网络。实验结果表明,该策略能够生成显著改进基于\textit{SRP-PHAT}策略的现有定位方法的网络。此外,实验表明与其他方法相比,我们的CNN方法对说话人性别变化和不同窗口大小具有更好的鲁棒性。
引用
@article{arxiv.1807.11094,
title = {Towards End-to-End Acoustic Localization using Deep Learning: from Audio Signal to Source Position Coordinates},
author = {Juan Manuel Vera-Diaz and Daniel Pizarro and Javier Macias-Guarasa},
journal= {arXiv preprint arXiv:1807.11094},
year = {2019}
}
备注
18 pages, 3 figures, 8 tables