用于复调音乐中主要乐器识别的深度卷积神经网络
声音
2016-12-28 v3 计算机视觉与模式识别
机器学习
神经与进化计算
摘要
识别复调音乐录音中的乐器是音乐信息检索领域一个具有挑战性但重要的问题。它支持按乐器搜索音乐、有助于识别音乐流派,或使音乐转写更轻松准确。在本文中,我们提出了一个卷积神经网络框架,用于真实世界复调音乐中的主要乐器识别。我们从具有单一标记主要乐器的固定长度音乐片段训练我们的网络,并从可变长度的音频信号中估计任意数量的主要乐器。为了获得音频片段级的结果,我们聚合了在测试音频上滑动窗口的多个输出。在此过程中,我们研究了两种不同的聚合方法:一种对每个乐器取平均值,另一种取逐乐器求和随后进行归一化。此外,我们对影响性能的若干重要因素进行了大量实验,包括分析窗口大小、识别阈值以及神经网络的激活函数,以寻找最优参数集。使用来自11种乐器的10k音频片段数据集进行评估,我们发现卷积神经网络比利用谱特征并结合支持向量机的源分离的传统方法更鲁棒。实验结果表明,所提出的卷积网络架构分别获得了0.602的微观F1值和0.503的宏观F1值,与其他最先进算法相比性能分别提高了19.6%和16.4%。
引用
@article{arxiv.1605.09507,
title = {Deep convolutional neural networks for predominant instrument recognition in polyphonic music},
author = {Yoonchang Han and Jaehun Kim and Kyogu Lee},
journal= {arXiv preprint arXiv:1605.09507},
year = {2016}
}
备注
13 pages, 7 figures, accepted for publication in IEEE/ACM Transactions on Audio, Speech, and Language Processing on 16-Nov-2016. This is initial submission version. Fully edited version is available at http://ieeexplore.ieee.org/document/7755799/