中文

基于单声道原始音频波形的深度卷积与循环网络复音乐器分类

声音 2021-02-16 v1 机器学习 音频与语音处理

摘要

声音事件检测与音频分类任务传统上通过音频信号的时频表示(如谱图)来处理。然而,深度神经网络作为高效特征提取器的出现使得音频信号可直接用于分类目的。在本文中,我们试图仅将复音音频的原始波形输入深度学习模型来识别乐器。我们考察并参数化了多种结合残差连接的循环与卷积架构,以构建具有低计算成本和最少预处理端到端的分类器。我们利用带有多重残差连接的并行 CNN-BiGRU 模型,通过 IRMAS 测试集获得了具有竞争力的分类分数和有用的乐器级洞察,同时保持了显著减少的可训练参数数量。

关键词

引用

@article{arxiv.2102.06930,
  title  = {Deep Convolutional and Recurrent Networks for Polyphonic Instrument Classification from Monophonic Raw Audio Waveforms},
  author = {Kleanthis Avramidis and Agelos Kratimenos and Christos Garoufis and Athanasia Zlatintsi and Petros Maragos},
  journal= {arXiv preprint arXiv:2102.06930},
  year   = {2021}
}

备注

5 pages, 4 figures, 6 tables, to be published in the Proc. of the 46th International Conference on Acoustics, Speech and Signal Processing (ICASSP 2021) @ Toronto, Ontario, Canada