中文

监督式音乐转录中的不变性与数据增广

机器学习 2017-11-15 v1 机器学习 声音 音频与语音处理

摘要

本文探索了多种基于帧的音乐转录模型,重点在于达到人类录音上最先进水平所需的方法。本文所讨论的平移不变网络将传统滤波器组与卷积神经网络相结合,是 2017 年 MIREX 多基频估计评测中性能最佳的模型。这类模型在对数频率域共享参数,利用音乐的频率不变性来减少模型参数数量并避免对训练数据的过拟合。本文中所有模型均使用来自 MusicNet 数据集的标注数据以监督方式训练,并通过保持标签的随机移调变换进行增广。

关键词

引用

@article{arxiv.1711.04845,
  title  = {Invariances and Data Augmentation for Supervised Music Transcription},
  author = {John Thickstun and Zaid Harchaoui and Dean Foster and Sham M. Kakade},
  journal= {arXiv preprint arXiv:1711.04845},
  year   = {2017}
}

备注

6 pages