使用掩蔽条件神经网络进行音乐流派自动分类
声音
2019-04-30 v2 机器学习
音频与语音处理
机器学习
摘要
用于声音识别的基于神经网络的架构通常改编自其他应用领域(如图像识别),这可能无法利用信号的时间-频率表示。条件神经网络(CLNN)及其扩展掩蔽条件神经网络(MCLNN)是为多维时间信号识别而设计的。CLNN 在一帧窗口上训练以保留帧间关系,MCLNN 在网络连接上施加系统的稀疏性,以模拟类滤波器组的行为。掩蔽操作引导网络在频带中学习,这降低了网络对时间-频率表示中频率偏移的敏感性。此外,掩码允许同时探索一系列特征组合,类似于为识别任务手动手工制作最优特征集合。与若干手工尝试相比,MCLNN 在 Ballroom 音乐数据集上取得了有竞争力的性能,并优于基于最先进卷积神经网络的模型。
引用
@article{arxiv.1801.05504,
title = {Automatic Classification of Music Genre using Masked Conditional Neural Networks},
author = {Fady Medhat and David Chesmore and John Robinson},
journal= {arXiv preprint arXiv:1801.05504},
year = {2019}
}
备注
Restricted Boltzmann Machine; RBM; Conditional RBM; CRBM; Deep Belief Net; DBN; Conditional Neural Network; CLNN; Masked Conditional Neural Network; MCLNN; Music Information Retrieval; MIR. IEEE International Conference on Data Mining (ICDM), 2017