基于多尺度密集连接卷积神经网络的音频场景分类样本丢弃方法
计算机视觉与模式识别
2018-06-13 v1
摘要
声学场景分类对机器而言是一个复杂的问题。作为一个新兴的研究领域,深度卷积神经网络(CNN)取得了令人信服的结果。在本文中,我们探索了使用多尺度密集连接卷积神经网络(DenseNet)进行分类任务,旨在提升分类性能,因为可以从音频信号的时频表示中提取多尺度特征。另一方面,以往大多数基于CNN的音频场景分类方法旨在通过采用不同的正则化技术(如隐藏单元丢弃和数据增强)来减少过拟合,从而提高分类准确率。众所周知,训练集中的离群值对训练模型有高度的负面影响,剔除离群值可能改善分类性能,而这在此前的研究中常被忽视。本文受语音信号处理中静音去除的启发,提出了一种新颖的样本丢弃方法,旨在去除训练数据集中的离群值。使用DCASE 2017音频场景分类数据集,实验结果表明所提出的多尺度DenseNet优于传统的单尺度DenseNet,而样本丢弃方法可进一步提升多尺度DenseNet的分类鲁棒性。
引用
@article{arxiv.1806.04422,
title = {Sample Dropout for Audio Scene Classification Using Multi-Scale Dense Connected Convolutional Neural Network},
author = {Dawei Feng and Kele Xu and Haibo Mi and Feifan Liao and Yan Zhou},
journal= {arXiv preprint arXiv:1806.04422},
year = {2018}
}
备注
Accepted to 2018 Pacific Rim Knowledge Acquisition Workshop (PKAW)