中文

基于多时间分辨率卷积神经网络结合多层次特征的环境声音分类

声音 2018-06-15 v2 音频与语音处理

摘要

鉴于不同声音类别的特征在不同时间尺度与层次级别上高度多样,本文提出一种新颖的深度卷积神经网络(CNN)架构用于环境声音分类任务。该网络架构以原始波形作为输入,并利用一组具有不同卷积核尺寸与步长的分离并行 CNN 来学习多时间分辨率的特征表示。另一方面,所提架构还通过卷积层之间的直接连接聚合来自多层次 CNN 层的分层特征用于分类,这超越了以往多数研究采用的典型单层次 CNN 特征。该网络架构还改善了信息流并避免了梯度消失问题。多层次特征的组合显著提升了分类性能。在两个数据集上进行了对比实验:环境声音分类数据集(ESC-50)与 DCASE 2017 音频场景分类数据集。结果表明,所提方法通过采用多时间分辨率与多层次特征在分类任务中极为有效,并且优于仅考虑单层次特征的先前方法。

关键词

引用

@article{arxiv.1805.09752,
  title  = {Environmental Sound Classification Based on Multi-temporal Resolution Convolutional Neural Network Combining with Multi-level Features},
  author = {Boqing Zhu and Kele Xu and Dezhi Wang and Lilun Zhang and Bo Li and Yuxing Peng},
  journal= {arXiv preprint arXiv:1805.09752},
  year   = {2018}
}

备注

Submit to PCM 2018