用于音频分类的卷积神经网络集成
音频与语音处理
2021-11-18 v2 机器学习
声音
摘要
本文提出并测试了利用多种数据增强技术与四种信号表示来训练卷积神经网络(CNNs)进行音频分类的分类器集成,并在三个公开可用的音频分类数据集上验证:i) 鸟鸣,ii) 猫叫声,以及 iii) 环境声音分类数据集。将结合数据增强技术与不同信号表示的最佳性能集成进行比较,结果显示其优于文献中报道的这些方法上的最佳方法。本文提出的方法在广泛使用的 ESC-50 数据集上取得了 state-of-the-art 结果。据我们所知,这是关于 CNN 集成用于音频分类最为广泛的研究。结果不仅表明 CNN 可被训练用于音频分类,而且表明使用不同技术的融合优于独立分类器。
引用
@article{arxiv.2007.07966,
title = {An Ensemble of Convolutional Neural Networks for Audio Classification},
author = {Loris Nanni and Gianluca Maguolo and Sheryl Brahnam and Michelangelo Paci},
journal= {arXiv preprint arXiv:2007.07966},
year = {2021}
}