基于卷积循环神经网络与分数级融合的亚谱图分割用于环境声音分类
声音
2019-08-19 v1 机器学习
音频与语音处理
摘要
环境声音分类(ESC)是一个重要且具有挑战性的问题,而特征表示是 ESC 中关键甚至决定性的因素。特征表示能力直接影响声音分类的准确率。因此,ESC 的性能在很大程度上依赖于从环境声音中提取的代表性特征的有效性。本文提出了一种基于亚谱图分割的 ESC 分类框架。此外,我们采用所提出的卷积循环神经网络(CRNN)与分数级融合来共同提高分类准确率。我们评估了多种截断方案,以寻找亚谱图的最优数量及相应的频带范围。基于数值实验,所提框架在公开数据集 ESC-50 上可达到 81.9% 的 ESC 分类准确率,相较传统基线方案提升了 9.1%。
引用
@article{arxiv.1908.05863,
title = {Sub-Spectrogram Segmentation for Environmental Sound Classification via Convolutional Recurrent Neural Network and Score Level Fusion},
author = {Tianhao Qiao and Shunqing Zhang and Zhichao Zhang and Shan Cao and Shugong Xu},
journal= {arXiv preprint arXiv:1908.05863},
year = {2019}
}
备注
accepted in the 2019 IEEE International Workshop on Signal Processing Systems (SiPS2019)