中文

采用深度可分离与膨胀卷积的声音事件检测

声音 2020-02-04 v1 机器学习 音频与语音处理

摘要

最先进的声音事件检测(SED)方法通常采用一系列卷积神经网络(CNNs)从输入音频信号中提取有用特征,再用循环神经网络(RNNs)对提取特征中更长的时间上下文建模。CNN的通道数与RNN权重矩阵的大小直接影响SED方法的参数量,达到数百万。此外,SED方法通常使用的长序列输入以及RNN的采用,带来了训练时间增加、梯度流动困难以及阻碍SED方法并行化等问题。为解决所有这些难题,我们提出以深度可分离卷积替换CNN,以膨胀卷积替换RNN。我们在SED任务上将所提方法与基线卷积神经网络比较,实现了参数量减少85%、每轮平均训练时间减少78%,并且平均逐帧F1分数提高4.6%、平均错误率降低3.8%。

关键词

引用

@article{arxiv.2002.00476,
  title  = {Sound Event Detection with Depthwise Separable and Dilated Convolutions},
  author = {Konstantinos Drossos and Stylianos I. Mimilakis and Shayan Gharib and Yanxiong Li and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2002.00476},
  year   = {2020}
}