基于卷积神经网络的音乐音频信号音色分析
声音
2017-06-05 v2
摘要
这项工作的重点是研究如何高效调整卷积神经网络(CNNs)以从 log-mel 幅度谱图学习音色表示。我们首先回顾设计 CNN 架构时的趋势。通过此文献综述,我们讨论了使用 CNN 高效学习音色表示所需考虑的关键点。基于此讨论,我们提出了一种旨在捕获学习音色所需相关时频上下文的设计策略,从而允许利用领域知识设计架构。此外,我们的主要目标之一是设计高效的 CNN 架构——这降低了这些模型过拟合的风险,因为其参数数量被最小化。基于我们所提设计原则的若干架构在音色相关的不同研究任务上成功得到评估:歌唱语音音素分类、乐器识别和音乐自动标注。
引用
@article{arxiv.1703.06697,
title = {Timbre Analysis of Music Audio Signals with Convolutional Neural Networks},
author = {Jordi Pons and Olga Slizovskaia and Rong Gong and Emilia Gómez and Xavier Serra},
journal= {arXiv preprint arXiv:1703.06697},
year = {2017}
}