中文

使用全卷积网络与掩码全局池化对变长音频文件进行分类

神经与进化计算 2016-07-12 v1 机器学习 多媒体 声音

摘要

我们训练了一个带有掩码全局池化的深度全卷积神经网络,用于 DCASE-2016 竞赛中的声学场景分类单标签分类以及家用音频标注多标签分类。我们的网络在声学场景识别的四折交叉验证中达到了 84.5% 的平均准确率,而提供的基线为 72.5%;在家用音频标注中达到了 0.17 的平均等错误率,而基线为 0.21。因此,该网络相对于基线分别提升了 17% 和 19%。该网络仅由卷积层组成以从短时傅里叶变换中提取特征,以及一个全局池化层来组合这些特征。特别地,除全连接输出层外,它既不具有全连接层,也不具有 dropout 层。

关键词

引用

@article{arxiv.1607.02857,
  title  = {Classifying Variable-Length Audio Files with All-Convolutional Networks and Masked Global Pooling},
  author = {Lars Hertel and Huy Phan and Alfred Mertins},
  journal= {arXiv preprint arXiv:1607.02857},
  year   = {2016}
}

备注

Technical report for the DCASE-2016 challenge (task 1 and task 4)