深度学习中音乐音频特征的声学表示
声音
2017-12-11 v1 计算机视觉与模式识别
音频与语音处理
神经元与认知
摘要
单个音乐家、团体或作曲家的作品在音乐风格上可能差异很大。事实上,从表演媒介、节奏到和声与织体等不同风格元素,通常在一个艺术家的生涯中被运用和发展。然而,在感知层面上,例如个别作曲家的作品往往具有可辨识的特征——有经验的听众常能捕捉音乐中的细微线索来识别作曲家或演奏者。在此我们提出,给定适当的音乐表示,卷积网络可以学习这些细微线索或特征。本文中,我们将深度卷积神经网络应用于大型音频数据集,并实证评估其在音频分类任务上的表现。我们训练的网络在输入由原始音频波形经简单变换得到的 5 秒音乐片段时,在此类分类任务上表现出准确性能。一个特别有趣的例子是通过对数间隔滤波器组得到的音乐谱表示,其反映了哺乳动物听觉信号转导的早期阶段。最有助于区分的音乐表示是通过随机矩阵变换(RMT)获得的。基于对数滤波器组和 RMT 的网络分别能在 68% 和 84% 的情况下从 31 位可能性中正确猜出作曲家。
引用
@article{arxiv.1712.02898,
title = {Representations of Sound in Deep Learning of Audio Features from Music},
author = {Sergey Shuvaev and Hamza Giaffar and Alexei A. Koulakov},
journal= {arXiv preprint arXiv:1712.02898},
year = {2017}
}