中文

DD-CNN:用于低复杂度声学场景分类的深度可分离Disout卷积神经网络

声音 2020-07-28 v1 机器学习 音频与语音处理

摘要

本文提出一种用于城市声学场景检测与分类的深度可分离Disout卷积神经网络(Depthwise Disout Convolutional Neural Network, DD-CNN)。具体而言,我们使用对数梅尔谱作为声学信号的特征表示,作为网络的输入。在所提出的DD-CNN中,深度可分离卷积用于降低网络复杂度。此外,SpecAugment和Disout被用于进一步提升性能。实验结果表明,我们的DD-CNN能够从音频片段中学习具有判别力的声学特征,并有效降低网络复杂度。我们的DD-CNN用于DCASE2020挑战赛的低复杂度声学场景分类任务,在验证集上达到了92.04%的准确率。

关键词

引用

@article{arxiv.2007.12864,
  title  = {DD-CNN: Depthwise Disout Convolutional Neural Network for Low-complexity Acoustic Scene Classification},
  author = {Jingqiao Zhao and Zhen-Hua Feng and Qiuqiang Kong and Xiaoning Song and Xiao-Jun Wu},
  journal= {arXiv preprint arXiv:2007.12864},
  year   = {2020}
}