使用原始波形的样本级深度卷积神经网络进行音乐自动标注
声音
2017-05-23 v2 机器学习
多媒体
神经与进化计算
摘要
最近,使用深度卷积神经网络从原始数据学习层次化表示的端到端方法已在图像、文本和语音领域得到成功探索。这种方法也被应用于音乐信号,但尚未被充分探索。为此,我们提出了样本级深度卷积神经网络,它从非常小的波形颗粒(例如2或3个样本)中学习表示,超越了典型的帧级输入表示。我们的实验表明,具有样本级滤波器的深层架构如何提高音乐自动标注的准确性,并在Magnatagatune数据集和Million Song Dataset上提供了与先前最先进性能相当的结果。此外,我们可视化了样本级DCNN中各层学习到的滤波器,以识别层次化学习的特征,并表明它们沿层对对数尺度频率敏感,例如在音乐分类系统中广泛使用的梅尔频率谱图。
引用
@article{arxiv.1703.01789,
title = {Sample-level Deep Convolutional Neural Networks for Music Auto-tagging Using Raw Waveforms},
author = {Jongpil Lee and Jiyoung Park and Keunhyoung Luke Kim and Juhan Nam},
journal= {arXiv preprint arXiv:1703.01789},
year = {2017}
}
备注
7 pages, Sound and Music Computing Conference (SMC), 2017