中文

联合声音分类与定位神经网络中的特征聚合

声音 2024-01-30 v2 机器学习 音频与语音处理

摘要

本研究探讨了深度学习技术在联合声音信号分类与定位网络中的应用。当前最先进的声源定位深度学习网络在其架构中缺乏特征聚合。特征聚合通过整合来自不同特征尺度的信息来增强模型性能,从而提升特征的鲁棒性与不变性。这在SSL(声源定位)网络中尤为重要,因为其必须区分直接与间接声学信号。为弥补这一不足,我们将计算机视觉神经网络中的特征聚合技术适配至信号检测神经网络。此外,我们提出了用于特征聚合的尺度编码网络(Scale Encoding Network, SEN),以编码来自不同尺度的特征,压缩网络以实现计算效率更高的聚合。为评估特征聚合在SSL网络中的有效性,我们将以下计算机视觉特征聚合子架构集成至一个SSL控制架构中:路径聚合网络(Path Aggregation Network, PANet)、加权双向特征金字塔网络(Weighted Bi-directional Feature Pyramid Network, BiFPN)与SEN。这些子架构使用两项信号分类指标与两项到达方向回归指标进行了评估。PANet与BiFPN是计算机视觉模型中成熟的聚合器,而所提出的SEN是一种更紧凑的聚合器。结果表明,在声音信号分类与定位方面,采用特征聚合的模型均优于控制模型——声音事件定位与检测网络(Sound Event Localization and Detection network, SELDnet)。特征聚合技术提升了声音检测神经网络的性能,尤其在到达方向回归方面。

关键词

引用

@article{arxiv.2310.19063,
  title  = {Feature Aggregation in Joint Sound Classification and Localization Neural Networks},
  author = {Brendan Healy and Patrick McNamee and Zahra Nili Ahmadabadi},
  journal= {arXiv preprint arXiv:2310.19063},
  year   = {2024}
}