基于卷积神经网络集成与统计特征的通用音频标注
计算机视觉与模式识别
2019-07-24 v1
摘要
音频标注旨在从音频片段中推断描述性标签。由于数据规模有限且标签含噪,音频标注具有挑战性。在本文中,我们描述了针对 DCASE 2018 Task 2 通用音频标注挑战赛的解决方案。我们方案的贡献包括:我们探究了多种卷积神经网络架构以解决音频标注任务;应用统计特征捕捉音频特征的统计模式以提升分类性能;采用集成学习对深度分类器的输出进行集成以利用互补信息;采用样本重加权策略进行集成训练以解决噪声标签问题。我们的系统取得了 0.958 的平均精度均值(mAP@3),优于 0.704 的基线系统。我们的系统在 DCASE 2018 Task 2 挑战赛公开榜和私有榜的 558 份提交中分别排名第 1 和第 4。我们的代码见 https://github.com/Cocoxili/DCASE2018Task2/。
引用
@article{arxiv.1810.12832,
title = {General audio tagging with ensembling convolutional neural network and statistical features},
author = {Kele Xu and Boqing Zhu and Qiuqiang Kong and Haibo Mi and Bo Ding and Dezhi Wang and Huaimin Wang},
journal= {arXiv preprint arXiv:1810.12832},
year = {2019}
}
备注
Submitted to ICASSP