声学事件的自适应多尺度检测
音频与语音处理
2019-11-26 v2 声音
摘要
声学(或声音)事件检测(AED 或 SED)的目标是在给定音频片段中预测目标事件的时间位置。该任务在安全监控、声学预警等场景中发挥着重要作用。然而,数据的匮乏与声学事件来源的多样性使得 AED 任务成为一个棘手的问题,尤其是对于当前主流的数据驱动方法。本文首先根据时频域特性对声学事件进行分析,表明不同声学事件具有不同的时频尺度特征。受此分析启发,我们提出了一种自适应多尺度检测(AdaMD)方法。通过利用沙漏神经网络与门控循环单元(GRU)模块,我们的 AdaMD 在不同时间与频率分辨率下产生多重预测。随后采用自适应训练算法将多尺度预测进行组合,以增强其整体能力。在 Detection and Classification of Acoustic Scenes and Events 2017(DCASE 2017)任务 2、DCASE 2016 任务 3 与 DCASE 2017 任务 3 上的实验结果表明,AdaMD 在事件错误率(ER)与 F1-score 指标上优于已发表的最先进竞争对手。在我们收集的工厂机械数据集上的验证实验也证明了 AdaMD 的抗噪能力,为其部署于复杂环境提供了可能。
引用
@article{arxiv.1911.06878,
title = {Adaptive Multi-scale Detection of Acoustic Events},
author = {Wenhao Ding and Liang He},
journal= {arXiv preprint arXiv:1911.06878},
year = {2019}
}
备注
IEEE/ACM TRANSACTIONS ON AUDIO, SPEECH, AND LANGUAGE PROCESSING (TASLP)