采用深度可分离与膨胀卷积的声音事件检测
声音
2020-02-04 v1 机器学习
音频与语音处理
摘要
最先进的声音事件检测(SED)方法通常采用一系列卷积神经网络(CNNs)从输入音频信号中提取有用特征,再用循环神经网络(RNNs)对提取特征中更长的时间上下文建模。CNN的通道数与RNN权重矩阵的大小直接影响SED方法的参数量,达到数百万。此外,SED方法通常使用的长序列输入以及RNN的采用,带来了训练时间增加、梯度流动困难以及阻碍SED方法并行化等问题。为解决所有这些难题,我们提出以深度可分离卷积替换CNN,以膨胀卷积替换RNN。我们在SED任务上将所提方法与基线卷积神经网络比较,实现了参数量减少85%、每轮平均训练时间减少78%,并且平均逐帧F1分数提高4.6%、平均错误率降低3.8%。
引用
@article{arxiv.2002.00476,
title = {Sound Event Detection with Depthwise Separable and Dilated Convolutions},
author = {Konstantinos Drossos and Stylianos I. Mimilakis and Shayan Gharib and Yanxiong Li and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2002.00476},
year = {2020}
}