PANNs:用于音频模式识别的大规模预训练音频神经网络
声音
2020-08-25 v5 音频与语音处理
摘要
音频模式识别是机器学习领域的重要研究课题,包含音频标注、声学场景分类、音乐分类、语音情感分类和声音事件检测等若干任务。近年来,神经网络已被应用于解决音频模式识别问题。然而,此前的系统构建于具有有限时长的特定数据集上。近来,在计算机视觉与自然语言处理中,在大规模数据集上预训练的系统已能很好地泛化到若干任务。然而,关于在大规模数据集上预训练音频模式识别系统的研究十分有限。本文中,我们提出在大规模 AudioSet 数据集上训练的预训练音频神经网络(PANNs)。这些 PANNs 被迁移至其他音频相关任务。我们考察了由多种卷积神经网络建模的 PANNs 的性能与计算复杂度。我们提出了一种同时使用 log-mel 谱图与波形作为输入特征的称为 Wavegram-Logmel-CNN 的架构。我们最佳的 PANN 系统在 AudioSet 标注上取得了 0.439 的最先进平均精度均值(mAP),优于此前最佳的 0.392 系统。我们将 PANNs 迁移至六项音频模式识别任务,并在其中若干任务上展示了最先进的性能。我们已发布 PANNs 的源代码与预训练模型:https://github.com/qiuqiangkong/audioset_tagging_cnn。
引用
@article{arxiv.1912.10211,
title = {PANNs: Large-Scale Pretrained Audio Neural Networks for Audio Pattern Recognition},
author = {Qiuqiang Kong and Yin Cao and Turab Iqbal and Yuxuan Wang and Wenwu Wang and Mark D. Plumbley},
journal= {arXiv preprint arXiv:1912.10211},
year = {2020}
}
备注
14 pages