中文

环境声音的深度学习模型比较

声音 2017-03-22 v1 机器学习

摘要

环境声音检测由于信号噪声大以及通常可用的(标记)数据量少,是机器学习的一个挑战性应用。因此,本工作比较了几种最先进的深度学习模型在IEEE声学场景与事件检测与分类(DCASE)2016挑战任务和数据上的表现,将声音分类为十五种常见室内外声学场景之一,如公交、咖啡馆、汽车、市中心、林间小道、图书馆、火车等。总共提供13小时立体声音频录音,使其成为可用的最大数据集之一。我们在六组特征上实验,包括标准梅尔频率倒谱系数(MFCC)、双耳MFCC、对数梅尔谱以及使用OpenSMILE提取的两种不同大规模时间池化特征。在这些特征上,我们应用五种模型:高斯混合模型(GMM)、深度神经网络(DNN)、循环神经网络(RNN)、卷积深度神经网络(CNN)和i-vector。使用后期融合方法,我们在4折交叉验证(CV)平均准确率上比基线72.5%提高15.6%,测试准确率提高11%,与DCASE 2016挑战的最佳结果匹配。在大型特征集上,深度神经网络模型优于传统方法,并在所有研究方法中取得最佳性能。与其他工作一致,性能最好的单一模型是非时间DNN模型,我们将其作为证据,表明DCASE挑战中的声音不表现出强时间动态。

关键词

引用

@article{arxiv.1703.06902,
  title  = {A Comparison of deep learning methods for environmental sound},
  author = {Juncheng Li and Wei Dai and Florian Metze and Shuhui Qu and Samarjit Das},
  journal= {arXiv preprint arXiv:1703.06902},
  year   = {2017}
}

备注

5 pages including reference