SubSpectralNet——基于子频谱图的卷积神经网络在声学场景分类中的应用
声音
2019-02-26 v2 音频与语音处理
摘要
声学场景分类(ASC)是计算声音场景分析领域的核心研究问题之一。本文提出 SubSpectralNet,一种通过引入频带级差异来建模声景、捕获判别性特征的新模型。利用梅尔频谱图,我们提出对输入时频表示的频带分块裁剪,并在其上训练卷积神经网络(CNN)。我们还提出了一种训练方法的改进,以更高效地学习 CNN 模型。我们首先通过直观与统计分析给出使用子频谱图的动机,最终开发了基于子频谱图的 CNN 架构用于 ASC。该系统在“声学场景与事件的检测与分类”(DCASE)2018 挑战赛提供的公开 ASC 开发数据集上进行了评估。相较 DCASE 2018 基线系统,我们的最佳模型在分类准确率上实现了 +14% 的提升。代码与图表见 https://github.com/ssrp/SubSpectralNet
引用
@article{arxiv.1810.12642,
title = {SubSpectralNet - Using Sub-Spectrogram based Convolutional Neural Networks for Acoustic Scene Classification},
author = {Sai Samarth R Phaye and Emmanouil Benetos and Ye Wang},
journal= {arXiv preprint arXiv:1810.12642},
year = {2019}
}
备注
Accepted to IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2019