中文

利用掩蔽条件神经网络的声学事件识别

机器学习 2019-04-30 v2 声音 音频与语音处理 机器学习

摘要

使用神经网络进行自动特征提取在图像方面取得了显著成功,但对于声音识别,这些模型通常被修改以适配音频信号在谱图中的多维时间表示。这可能无法有效利用信号的时间-频率表示。条件神经网络(CLNN)考虑了时间帧之间的相互关系,而掩蔽条件神经网络(MCLNN)在 CLNN 基础上通过使用二值掩码强制网络权重上的系统性稀疏性进行了扩展。该掩蔽使网络能够学习频带而非频 bin,模拟了诸如 MFCC 等信号变换中使用的滤波器组。此外,该掩码被设计为考虑特征的各种组合,从而自动化了特征手工提取过程。我们将 MCLNN 应用于环境声音识别问题,使用了 Urbansound8k、YorNoise、ESC-10 和 ESC-50 数据集。与最先进(state-of-the-art)的卷积神经网络和手工提取尝试相比,MCLNN 取得了具有竞争力的性能。

关键词

引用

@article{arxiv.1802.02617,
  title  = {Recognition of Acoustic Events Using Masked Conditional Neural Networks},
  author = {Fady Medhat and David Chesmore and John Robinson},
  journal= {arXiv preprint arXiv:1802.02617},
  year   = {2019}
}

备注

Restricted Boltzmann Machine, RBM, Conditional Restricted Boltzmann Machine, CRBM, Conditional Neural Networks, CLNN, Masked Conditional Neural Networks, MCLNN, Deep Neural Network, Environmental Sound Recognition, ESR