中文

基于原始波形的使用样本级 CNN 架构的音频分类

声音 2017-12-05 v1 机器学习 多媒体 音频与语音处理

摘要

音乐、语音与声学场景声音在音频域中常因其不同的信号特性而被分开处理。然而,随着图像域借助通用图像分类模型快速发展,研究音频域中可扩展的分类模型亦属必要。本研究中,我们使用两类以原始波形为输入且采用细粒度滤波器的样本级深度卷积神经网络来解决此问题。其一为包含卷积与池化层的基础模型;另一为附加了残差连接、压缩激励(squeeze-and-excitation)模块与多级拼接的改进模型。我们表明样本级模型在三类不同声音上达到了最先进(state-of-the-art)性能水平。此外,我们可视化各层滤波器并比较所学滤波器的特性。

关键词

引用

@article{arxiv.1712.00866,
  title  = {Raw Waveform-based Audio Classification Using Sample-level CNN Architectures},
  author = {Jongpil Lee and Taejun Kim and Jiyoung Park and Juhan Nam},
  journal= {arXiv preprint arXiv:1712.00866},
  year   = {2017}
}

备注

NIPS, Machine Learning for Audio Signal Processing Workshop (ML4Audio), 2017