用于定位声源的双输入神经网络
声音
2023-08-09 v1 机器学习
音频与语音处理
摘要
在许多信号处理应用中,元数据可与高维信号结合使用以产生期望输出。在经典声源定位(SSL)算法中,由多个分布式麦克风接收的高维多通道音频信号的信息,与描述场景声学特性(如麦克风空间坐标)的信息相结合,以估计声源位置。我们提出双输入神经网络(DI-NN)作为一种在神经网络中建模这两类数据的简单有效方法。我们在不同难度和真实度的场景下训练并评估所提出的 DI-NN,并将其与另一种架构、经典最小二乘(LS)方法以及经典卷积循环神经网络(CRNN)进行比较。结果表明,DI-NN 显著优于基线,在真实录音测试数据集中定位误差比 LS 方法低五倍,比 CRNN 低两倍。
引用
@article{arxiv.2308.04169,
title = {Dual input neural networks for positional sound source localization},
author = {Eric Grinstein and Vincent W. Neo and Patrick A. Naylor},
journal= {arXiv preprint arXiv:2308.04169},
year = {2023}
}