使用原始波形的音乐自动标注的采样级 CNN 架构
声音
2018-02-15 v2 机器学习
多媒体
神经与进化计算
音频与语音处理
摘要
近期工作表明,使用卷积神经网络(CNN)的端到端方法在各种机器学习任务中是有效的。对于音频信号,该方法使用一维卷积层将原始波形作为输入。在本文中,我们通过采用最先进图像分类模型(ResNets 和 SENets)中的构建模块,并为其添加多级特征聚合,改进了用于音乐自动标注的一维 CNN 架构。我们比较了构建 CNN 架构中这些模块的不同组合。结果表明,它们在 MagnaTagATune 数据集上比先前最先进的模型有显著提升,在 Million Song Dataset 上取得了可比的结果。此外,我们分析并可视化了我们的模型,以展示一维 CNN 的运作方式。
引用
@article{arxiv.1710.10451,
title = {Sample-level CNN Architectures for Music Auto-tagging Using Raw Waveforms},
author = {Taejun Kim and Jongpil Lee and Juhan Nam},
journal= {arXiv preprint arXiv:1710.10451},
year = {2018}
}
备注
Accepted for publication at ICASSP 2018