中文

基于两阶段策略的多音 Sound 事件检测与定位

声音 2019-11-06 v4 音频与语音处理

摘要

声音事件检测(SED)与定位是指识别声音事件并估计其空间与时间位置。使用神经网络已成为 SED 的主流方法。在通常借助到达方向(DOA)估计来实现的声音定位领域,基于学习的方法近来已有发展。本文通过实验表明,训练好的 SED 模型有助于到达方向估计(DOAE)。然而,SED 与 DOAE 的联合训练会使两者性能均下降。基于这些结果,提出了一种两阶段多音声音事件检测与定位方法。该方法先学习 SED,再将所学特征层迁移用于 DOAE,随后以 SED 真值作为掩码来训练 DOAE。所提方法在 DCASE 2019 Task 3 数据集上进行了评估,该数据集包含不同环境中多种重叠声音事件。实验结果表明,所提方法能够提升 SED 与 DOAE 两者的性能,并且显著优于基线方法。

关键词

引用

@article{arxiv.1905.00268,
  title  = {Polyphonic Sound Event Detection and Localization using a Two-Stage Strategy},
  author = {Yin Cao and Qiuqiang Kong and Turab Iqbal and Fengyan An and Wenwu Wang and Mark D. Plumbley},
  journal= {arXiv preprint arXiv:1905.00268},
  year   = {2019}
}

备注

6 pages, 2 figures, conference