中文

使用原始波形的音乐自动标注的采样级 CNN 架构

声音 2018-02-15 v2 机器学习 多媒体 神经与进化计算 音频与语音处理

摘要

近期工作表明,使用卷积神经网络(CNN)的端到端方法在各种机器学习任务中是有效的。对于音频信号,该方法使用一维卷积层将原始波形作为输入。在本文中,我们通过采用最先进图像分类模型(ResNets 和 SENets)中的构建模块,并为其添加多级特征聚合,改进了用于音乐自动标注的一维 CNN 架构。我们比较了构建 CNN 架构中这些模块的不同组合。结果表明,它们在 MagnaTagATune 数据集上比先前最先进的模型有显著提升,在 Million Song Dataset 上取得了可比的结果。此外,我们分析并可视化了我们的模型,以展示一维 CNN 的运作方式。

关键词

引用

@article{arxiv.1710.10451,
  title  = {Sample-level CNN Architectures for Music Auto-tagging Using Raw Waveforms},
  author = {Taejun Kim and Jongpil Lee and Juhan Nam},
  journal= {arXiv preprint arXiv:1710.10451},
  year   = {2018}
}

备注

Accepted for publication at ICASSP 2018