音频标注的正确打开方式:深度学习环境声分类方法第二次对比
声音
2022-08-25 v3 音频与语音处理
摘要
在视觉与语言任务取得压倒性成功之后,纯基于注意力的神经架构(如 DeiT)正崭露头角登上音频标注(AT)排行榜顶端,看似令传统卷积神经网络(CNN)、前馈网络或循环网络过时。然而细察之下,已发表研究差异巨大,例如,用预训练权重初始化的模型性能与无预训练时截然不同,模型训练时间从数小时到数周不等,且精髓常藏于看似琐碎的细节中。由于我们首次对比已距今半个十年,这迫切呼唤一项全面研究。本工作中,我们在最大弱标注声音事件数据集 AudioSet 上进行了大量实验,并基于数据质量与效率做了分析。我们比较了 AT 任务上若干 SOTA 基线,并研究了两类主要神经架构——CNN 变体与基于注意力的变体——的性能与效率。我们还细致考察了其优化过程。我们开源的实验结果为实践者与研究者提供了在性能、效率、优化过程间权衡的洞见。实现:https://github.com/lijuncheng16/AudioTaggingDoneRight
引用
@article{arxiv.2203.13448,
title = {AudioTagging Done Right: 2nd comparison of deep learning methods for environmental sound classification},
author = {Juncheng B Li and Shuhui Qu and Po-Yao Huang and Florian Metze},
journal= {arXiv preprint arXiv:2203.13448},
year = {2022}
}