中文

基于 SRP-PHAT 与三维卷积神经网络的鲁棒声源跟踪

音频与语音处理 2020-12-18 v2 机器学习 声音 信号处理

摘要

在本文中,我们提出一种基于著名 SRP-PHAT 算法和三维卷积神经网络的单声源 DOA 估计与跟踪系统。它使用 SRP-PHAT 功率图作为全卷积因果架构的输入特征,该架构采用 3D 卷积层,即使在大多数前沿技术失效的高混响场景中也能准确跟踪声源。与以往方法不同,由于我们不使用双向循环层且所有卷积层在时间维度上均为因果的,我们的系统可应用于实时场景,并为每个新 SRP-PHAT 图提供新的 DOA 估计。为训练模型,我们引入一种新流程来模拟随机轨迹(训练所需),其等价于具有高度灵活修改声学条件(如混响时间)能力的无限大小数据集。我们使用大范围混响时间的声学仿真以及 LOCATA 数据集的实际录音来证明我们系统的鲁棒性,以及即使使用低分辨率 SRP-PHAT 图也具有良好的性能。

关键词

引用

@article{arxiv.2006.09006,
  title  = {Robust Sound Source Tracking Using SRP-PHAT and 3D Convolutional Neural Networks},
  author = {David Diaz-Guerra and Antonio Miguel and Jose R. Beltran},
  journal= {arXiv preprint arXiv:2006.09006},
  year   = {2020}
}

备注

This is a pre-print of an article published in IEEE/ACM Transactions on Audio Speech and Language Processing. The code to reproduce this work can be found in our GitHub repository: https://github.com/DavidDiazGuerra/Cross3D