基于多特征通道与注意力深度卷积神经网络的环境声音分类
声音
2020-12-09 v9 机器学习
音频与语音处理
机器学习
摘要
本文提出一种用于环境声音分类任务(ESC)的模型,该模型将多个特征通道作为输入送入带注意力机制的深度卷积神经网络(CNN)。本文的新颖之处在于使用由梅尔频率倒谱系数(MFCC)、伽马通频率倒谱系数(GFCC)、恒Q变换(CQT)和色度图组成的多特征通道。此类多特征此前从未用于信号或音频处理。并且,相较于先前模型,我们采用了更深的CNN(DCNN),其由分别在时间和特征域上工作的空间可分离卷积构成。同时,我们使用执行通道与空间联合注意力的注意力模块。我们采用一些数据增强技术以进一步提升性能。我们的模型在所有三个基准环境声音分类数据集上均达到最先进性能,即UrbanSound8K(97.52%)、ESC-10(95.75%)和ESC-50(88.50%)。据我们所知,这是首个单一环境声音分类模型能在所有三个数据集上均取得最先进结果的模型。对于ESC-10和ESC-50数据集,所提模型达到的准确率分别超越了95.7%和81.3%的人类准确率。
引用
@article{arxiv.1908.11219,
title = {Environment Sound Classification using Multiple Feature Channels and Attention based Deep Convolutional Neural Network},
author = {Jivitesh Sharma and Ole-Christoffer Granmo and Morten Goodwin},
journal= {arXiv preprint arXiv:1908.11219},
year = {2020}
}
备注
Re-checking results