中文

FastAST: 通过令牌合并和跨模型知识蒸馏加速音频频谱图Transformer

声音 2024-06-13 v1 人工智能 机器学习 多媒体 音频与语音处理

摘要

音频分类模型,特别是音频频谱图Transformer (AST),在高效音频分析中扮演着关键角色。然而,在保证准确率的同时优化其效率仍然是一个挑战。在本文中,我们介绍了FastAST,一个将令牌合并(ToMe)集成到AST框架中的框架。FastAST通过合并音频频谱图中的相似令牌,在无需大量重新训练的情况下提高了推理速度。此外,在训练过程中,FastAST带来了显著的加速。实验表明,FastAST可以在对准确率影响最小的情况下提高音频分类的吞吐量。为了减轻对准确率的影响,我们将跨模型知识蒸馏(CMKD)集成到FastAST框架中。将ToMe和CMKD集成到AST中,与AST相比,在保持更快推理速度的同时提高了准确率。FastAST代表了向实时、资源高效的音频分析迈出的一步。

关键词

引用

@article{arxiv.2406.07676,
  title  = {FastAST: Accelerating Audio Spectrogram Transformer via Token Merging and Cross-Model Knowledge Distillation},
  author = {Swarup Ranjan Behera and Abhishek Dhiman and Karthik Gowda and Aalekhya Satya Narayani},
  journal= {arXiv preprint arXiv:2406.07676},
  year   = {2024}
}

备注

Accepted to Interspeech 2024