中文

用于环境声音分类的深度卷积神经网络与数据增强

声音 2017-04-05 v2 计算机视觉与模式识别 机器学习 神经与进化计算

摘要

深度卷积神经网络(CNN)学习判别性谱-时间模式的能力使其非常适合于环境声音分类。然而,标注数据的相对稀缺阻碍了这类高容量模型的利用。本研究有两个主要贡献:首先,我们提出了一种用于环境声音分类的深度卷积神经网络架构。其次,我们提出使用音频数据增强来克服数据稀缺问题,并探索不同增强对所提CNN架构性能的影响。结合数据增强,所提模型产生了环境声音分类的最先进结果。我们表明,性能的提升源于深度高容量模型与增强训练集的结合:该结合优于无增强的所提CNN以及带增强的"浅层"字典学习模型。最后,我们考察了每种增强对每个类别的分类准确率的影响,观察到每个类别的准确率受不同增强的影响不同,这表明通过应用类条件数据增强可进一步提升模型性能。

关键词

引用

@article{arxiv.1608.04363,
  title  = {Deep Convolutional Neural Networks and Data Augmentation for Environmental Sound Classification},
  author = {Justin Salamon and Juan Pablo Bello},
  journal= {arXiv preprint arXiv:1608.04363},
  year   = {2017}
}

备注

Accepted November 2016, IEEE Signal Processing Letters. Copyright IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material, creating new collective works, for resale or redistribution, or reuse of any copyrighted component of this work in other works