中文

使用卷积神经网络与多宽度频域差分数据增强的声学场景分类

声音 2016-07-11 v1

摘要

近年来,神经网络方法在众多应用领域展现出优于传统手工特征的性能。特别是,卷积神经网络(ConvNet)利用输入数据间的空间局部相关性来提升音频处理任务的性能,如语音识别、音乐和弦识别和音符起始检测。在此,我们将 ConvNet 应用于声学场景分类,并表明在频域中使用差分特征可以进一步降低错误率。我们提出了一种多宽度频域差分(MWFD)数据增强方法,该方法使用静态 mel 频谱图和频域差分特征作为独立的输入样本。此外,我们描述了一种专为 MWFD 增强设计的 ConvNet 输出聚合方法,即折叠均值聚合,该方法首先使用乘法组合来自同一分析窗口的静态特征和 MWFD 特征的输出概率,而不是对所有输出概率取平均值。我们给出了使用 DCASE 2016 挑战赛数据集的计算结果,结果表明 ConvNet 的性能比使用手工特征的基线系统和深度神经网络方法均高出约 7%。将 MWFD 增强与折叠均值聚合结合使用,性能得到了进一步提升(提升 5.7%)。在对 15 个声学场景进行分类时,该系统的分类准确率达到 0.831。

关键词

引用

@article{arxiv.1607.02383,
  title  = {Acoustic scene classification using convolutional neural network and multiple-width frequency-delta data augmentation},
  author = {Yoonchang Han and Kyogu Lee},
  journal= {arXiv preprint arXiv:1607.02383},
  year   = {2016}
}

备注

11 pages, 5 figures, submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing on 08-July-2016