使用全卷积网络与掩码全局池化对变长音频文件进行分类
神经与进化计算
2016-07-12 v1 机器学习
多媒体
声音
摘要
我们训练了一个带有掩码全局池化的深度全卷积神经网络,用于 DCASE-2016 竞赛中的声学场景分类单标签分类以及家用音频标注多标签分类。我们的网络在声学场景识别的四折交叉验证中达到了 84.5% 的平均准确率,而提供的基线为 72.5%;在家用音频标注中达到了 0.17 的平均等错误率,而基线为 0.21。因此,该网络相对于基线分别提升了 17% 和 19%。该网络仅由卷积层组成以从短时傅里叶变换中提取特征,以及一个全局池化层来组合这些特征。特别地,除全连接输出层外,它既不具有全连接层,也不具有 dropout 层。
引用
@article{arxiv.1607.02857,
title = {Classifying Variable-Length Audio Files with All-Convolutional Networks and Masked Global Pooling},
author = {Lars Hertel and Huy Phan and Alfred Mertins},
journal= {arXiv preprint arXiv:1607.02857},
year = {2016}
}
备注
Technical report for the DCASE-2016 challenge (task 1 and task 4)