中文

你能降多低?在现有音乐自动标注 CNN 架构中降低频率与时间分辨率

信息检索 2020-06-30 v3 声音 音频与语音处理

摘要

音乐自动标注是音乐信息检索中的一个重要研究课题,针对该任务提出的音频分析算法随着深度学习的进展取得了改进。特别是,许多最先进的系统使用卷积神经网络并在音频的梅尔谱图表示上运行。本文中,我们比较了常用的梅尔谱图表示,并评估了通过减少输入尺寸(即更少的频带数量和更大的帧率)所能达到的模型性能。我们使用 MagnaTagaTune 数据集进行全面性能比较,然后在更大的 Million Song Dataset 上比较所选配置。本研究的结果可服务于研究者和从业者在模型精度、数据存储大小以及训练和推理时间之间权衡决策。

关键词

引用

@article{arxiv.1911.04824,
  title  = {How Low Can You Go? Reducing Frequency and Time Resolution in Current CNN Architectures for Music Auto-tagging},
  author = {Andres Ferraro and Dmitry Bogdanov and Xavier Serra and Jay Ho Jeon and Jason Yoon},
  journal= {arXiv preprint arXiv:1911.04824},
  year   = {2020}
}

备注

The 28th European Signal Processing Conference (EUSIPCO)