中文

基于卷积神经网络的低频自适应高精度声源定位

声音 2024-10-01 v1 音频与语音处理

摘要

声源定位 (SSL) 技术在故障诊断、语音分离和振动噪声消除等多个应用领域中发挥着关键作用。虽然波束成形算法在 SSL 中广泛使用,但其在低频率的分辨率受到限制。近年来,深度学习-based SSL 方法通过采用大型麦克风阵列和训练特定神经网络显著提高了准确性,但这可能导致适用性狭窄。为此,本文提出一种基于卷积神经网络的方法,用于低于 1kHz 的自适应高精度 SSL,适用于不同数量的声源和麦克风阵列到扫描网格的距离。该方法将相对小的麦克风阵列上的压力分布作为神经网络的输入,并采用定制的训练标签和损失函数训练模型。评估了在特定信噪比 (SNR) 下训练模型的预测准确性、适应性和鲁棒性,使用随机生成的测试数据集进行测试,并与经典波束成形算法、CLEAN-SC 和 DAMAS 进行比较。平面和空间声源分布的结果表明,所提神经网络模型在低频率定位准确性方面显著提高,证明了其在 SSL 中的有效性和潜力。

关键词

引用

@article{arxiv.2409.20031,
  title  = {Adaptive high-precision sound source localization at low frequencies based on convolutional neural network},
  author = {Wenbo Ma and Yan Lu and Yijun Liu},
  journal= {arXiv preprint arXiv:2409.20031},
  year   = {2024}
}