中文

BeamLearning:一种利用原始多通道声压数据进行声源角度定位的端到端深度学习方法

音频与语音处理 2021-06-16 v1 声音

摘要

基于多通道信号处理的声源定位数十年来一直是活跃的研究课题。近年来,深度学习在音频信号处理中的使用大幅提升了机器听觉的性能。这促使科学界也开发用于声源定位应用的机器学习策略。本文中,我们提出 BeamLearning,一种多分辨率深度学习方法,可对麦克风阵列捕获的未处理时域声学信号中所包含的相关信息进行编码。使用原始数据旨在避免大多数传统基于模型的定位方法所依赖的简化假设。其在混响与噪声环境下的实时声源二维定位任务中的优势得以展现。由于监督式机器学习方法需要大规模、物理真实且精确标注的数据集,我们还开发了基于 GPU 的快速房间脉冲响应计算,对镜像源模型使用分数延迟。我们利用合成与实验数据集对 BeamLearning 网络进行了网络表示的深入分析与广泛的性能测试。所得结果表明,在存在强测量噪声与混响的情况下,BeamLearning 方法在定位精度与计算效率上显著优于宽带 MUSIC 与 SRP-PHAT 方法。

关键词

引用

@article{arxiv.2104.13347,
  title  = {BeamLearning: an end-to-end Deep Learning approach for the angular localization of sound sources using raw multichannel acoustic pressure data},
  author = {Hadrien Pujol and Éric Bavu and Alexandre Garcia},
  journal= {arXiv preprint arXiv:2104.13347},
  year   = {2021}
}

备注

The following article has been submitted to the special issue on Machine Learning in Acoustics in JASA. After it is published, it will be found at http://asa.scitation.org/journal/jas