用于自动声音事件识别的掩码条件神经网络
机器学习
2019-04-30 v2 声音
音频与语音处理
机器学习
摘要
为图像识别等非声音应用领域设计的深度神经网络架构,在适配到声音识别问题时,可能无法最优地利用时频表示。在本工作中,我们探索条件神经网络(CLNN)与掩码条件神经网络(MCLNN)用于多维时间信号识别。CLNN 考虑帧间关系,而 MCLNN 在网络连接上强制系统性的稀疏性,从而能够在频带而非频 bin 上学习,使网络具有频移不变性,模拟滤波器组。该掩码还允许同时考虑多种特征组合,而这通常通过穷举式人工搜索手工完成。我们将 MCLNN 应用于环境声音识别问题,使用 ESC-10 与 ESC-50 数据集。在不使用数据增强且仅用 12% 参数的情况下,MCLNN 取得了与最先进的卷积神经网络(CNN)相竞争的性能。
引用
@article{arxiv.1802.05792,
title = {Masked Conditional Neural Networks for Automatic Sound Events Recognition},
author = {Fady Medhat and David Chesmore and John Robinson},
journal= {arXiv preprint arXiv:1802.05792},
year = {2019}
}
备注
Restricted Boltzmann Machine, RBM, Conditional RBM, CRBM, Deep Belief Net, DBN, Conditional Neural Network, CLNN, Masked Conditional Neural Network, MCLNN, Environmental Sound Recognition, ESR