中文

通过Transformer到CNN的知识蒸馏实现高效大规模音频标记

声音 2023-06-26 v3 机器学习 音频与语音处理

摘要

音频频谱图Transformer模型主导了音频标记领域,超越了此前占主导地位的卷积神经网络(CNN)。其优越性基于其扩展能力及利用AudioSet等大规模数据集的能力。然而,与CNN相比,Transformer在模型大小和计算需求方面要求更高。我们提出了一种基于从高性能但复杂的Transformer进行离线知识蒸馏(KD)的高效CNN训练流程。所提出的训练方案及基于MobileNetV3的高效CNN设计,使模型在参数效率、计算效率和预测性能方面均优于先前解决方案。我们提供了不同复杂度级别的模型,从低复杂度模型扩展到在AudioSet上达到0.483 mAP的最新性能。源代码可在以下地址获取:https://github.com/fschmid56/EfficientAT

关键词

引用

@article{arxiv.2211.04772,
  title  = {Efficient Large-scale Audio Tagging via Transformer-to-CNN Knowledge Distillation},
  author = {Florian Schmid and Khaled Koutini and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2211.04772},
  year   = {2023}
}

备注

In Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) 2023. Source Code available at: https://github.com/fschmid56/EfficientAT