中文

基于卷积神经网络集成与统计特征的通用音频标注

计算机视觉与模式识别 2019-07-24 v1

摘要

音频标注旨在从音频片段中推断描述性标签。由于数据规模有限且标签含噪,音频标注具有挑战性。在本文中,我们描述了针对 DCASE 2018 Task 2 通用音频标注挑战赛的解决方案。我们方案的贡献包括:我们探究了多种卷积神经网络架构以解决音频标注任务;应用统计特征捕捉音频特征的统计模式以提升分类性能;采用集成学习对深度分类器的输出进行集成以利用互补信息;采用样本重加权策略进行集成训练以解决噪声标签问题。我们的系统取得了 0.958 的平均精度均值(mAP@3),优于 0.704 的基线系统。我们的系统在 DCASE 2018 Task 2 挑战赛公开榜和私有榜的 558 份提交中分别排名第 1 和第 4。我们的代码见 https://github.com/Cocoxili/DCASE2018Task2/。

关键词

引用

@article{arxiv.1810.12832,
  title  = {General audio tagging with ensembling convolutional neural network and statistical features},
  author = {Kele Xu and Boqing Zhu and Qiuqiang Kong and Haibo Mi and Bo Ding and Dezhi Wang and Huaimin Wang},
  journal= {arXiv preprint arXiv:1810.12832},
  year   = {2019}
}

备注

Submitted to ICASSP