中文

CMKD:基于 CNN/Transformer 的跨模型知识蒸馏用于音频分类

声音 2022-03-15 v1 人工智能 音频与语音处理

摘要

音频分类是一个具有广泛应用的研究活跃领域。在过去十年中,卷积神经网络(CNN)一直是端到端音频分类模型事实上的标准构建模块。最近,仅基于自注意力机制的神经网络(如 Audio Spectrogram Transformer(AST))已被证明优于 CNN。在本文中,我们发现了这两种差异极大的模型之间一种有趣的相互作用——CNN 与 AST 模型互为良好的教师模型。当我们将其中任一模型用作教师,并通过知识蒸馏(KD)训练另一模型作为学生时,学生模型的性能显著提升,且在许多情况下优于教师模型。在我们采用这种 CNN/Transformer 跨模型知识蒸馏(CMKD)方法的实验中,我们在 FSD50K、AudioSet 和 ESC-50 上取得了新的最先进性能。

关键词

引用

@article{arxiv.2203.06760,
  title  = {CMKD: CNN/Transformer-Based Cross-Model Knowledge Distillation for Audio Classification},
  author = {Yuan Gong and Sameer Khurana and Andrew Rouditchenko and James Glass},
  journal= {arXiv preprint arXiv:2203.06760},
  year   = {2022}
}