中文

PSELDNets:基于大规模合成数据集的预训练神经网络用于声音事件定位与检测

音频与语音处理 2025-07-03 v2 声音

摘要

基于学习的声音事件定位与检测(SELD)已取得了实质性进展。这些系统通常针对特定数据集从头训练,已展现出显著的泛化能力。最近,在大型数据集上训练的深度神经网络在声音事件分类(SEC)领域取得了显著成功,这引发了一个开放性问题:这些进展能否扩展到SELD基础模型的开发。在本文中,我们利用预训练SEC模型的力量,提出了在大规模合成数据集上的预训练SELD网络(PSELDNets)。该合成数据集通过将声音事件与模拟空间房间脉冲响应(SRIRs)卷积生成,包含1167小时的音频片段,涵盖170种声音类别的本体论。这些PSELDNets被应用于各种SELD场景。当我们将PSELDNets适配到特定场景,特别是低资源数据的情况下,我们引入了一种数据高效的微调方法AdapterBit。PSELDNets在合成测试集上使用来自TAU空间房间脉冲响应数据库(TAU-SRIR DB)收集的SRIRs进行评估,取得了令人满意的性能。我们还进行了实验以验证PSELDNets向三个公开可用数据集和我们自己的真实录音的迁移性。结果表明,PSELDNets在所有公开可用数据集上超越了最先进的系统。鉴于到达方向估计的需要,SELD通常依赖充分的多通道音频片段。然而,通过引入AdapterBit,PSELDNets展示了使用最少的多通道甚至仅单声道音频片段对各种场景的更高效适应性,优于传统的微调方法。

关键词

引用

@article{arxiv.2411.06399,
  title  = {PSELDNets: Pre-trained Neural Networks on a Large-scale Synthetic Dataset for Sound Event Localization and Detection},
  author = {Jinbo Hu and Yin Cao and Ming Wu and Fang Kang and Feiran Yang and Wenwu Wang and Mark D. Plumbley and Jun Yang},
  journal= {arXiv preprint arXiv:2411.06399},
  year   = {2025}
}

备注

16 pages, 9 figures, accepted by IEEE Transactions on Audio, Speech, and Language Processing. The code is available at https://github.com/Jinbo-Hu/PSELDNets