中文

基于音频的音乐分类:使用DenseNet与数据增强

音频与语音处理 2019-06-28 v1 多媒体 声音

摘要

近年来,深度学习技术因其在图像识别领域的巨大成功而受到广泛关注。深度学习在包括音乐信息检索(MIR)在内的各种信息处理领域中的应用趋势已经形成。在本文中,我们利用改进的卷积神经网络(CNN)对音乐音频分类进行了全面研究。据我们所知,这是首次将密集连接卷积网络(DenseNet)应用于音乐音频标签的工作,该网络已被证明性能优于残差神经网络(ResNet)。此外,我们提出了时间重叠和音高移位两种特定的数据增强方法,以解决MIR中标注数据不足的问题。并且,基于支持向量机(SVM)采用了堆叠集成学习。我们相信,所提出的DenseNet强大表示能力与数据增强的结合可以适应于其他音频处理任务。

关键词

引用

@article{arxiv.1906.11620,
  title  = {Audio-Based Music Classification with DenseNet And Data Augmentation},
  author = {Wenhao Bian and Jie Wang and Bojin Zhuang and Jiankui Yang and Shaojun Wang and Jing Xiao},
  journal= {arXiv preprint arXiv:1906.11620},
  year   = {2019}
}

备注

accepted by The 16th Pacific Rim International Conference on AI