用于基于 CRNN 的多声源定位的改进特征提取
声音
2021-05-06 v1 音频与语音处理
摘要
本工作中,我们提出扩展一种基于卷积循环神经网络与 Ambisonics 信号的最先进多声源定位系统。我们通过改变卷积层与池化层之间的布局,显著提升了基线网络的性能。我们提出若干配置,具有更多卷积层和更小的层间池化尺寸,从而跨层损失的信息更少,带来更好的特征提取。同时,我们测试系统定位多达 3 个声源的能力,在此情况下改进的特征提取带来了最显著的精度提升。我们在合成与真实世界数据上评估并比较这些改进配置。所得结果显示多声源定位性能相较基线网络有相当大幅度的提升。
引用
@article{arxiv.2105.01897,
title = {Improved feature extraction for CRNN-based multiple sound source localization},
author = {Pierre-Amaury Grumiaux and Srdan Kitic and Laurent Girin and Alexandre Guérin},
journal= {arXiv preprint arXiv:2105.01897},
year = {2021}
}
备注
5 pages, 2 figures. Accepted to EUSIPCO 2021