中文

高效音频频谱 Transformer 的适配器增量持续学习

声音 2024-01-03 v2 音频与语音处理

摘要

持续学习涉及增量地训练神经网络以完成新任务,同时保留对先前任务的知识。然而,以最少的计算资源对模型进行顺序任务的高效微调仍然是一个挑战。在本文中,我们提出了兼具参数高效与计算高效的音频频谱 Transformer(AST)的音频分类器任务增量持续学习(TI-CL)。为了在不降低 TI-CL 性能的情况下减少可训练参数,我们比较了几种参数高效迁移(PET)方法,并提出了用于 TI-CL 的带卷积适配器的 AST,其可训练参数不到完全微调对应模型的 5%。为了降低计算复杂度,我们引入了一种新颖的频率-时间分解注意力(FTA)方法,用以替代 Transformer 中用于音频频谱的传统自注意力。FTA 仅需全局自注意力(GSA)所需计算量的一个因子倍数,即可实现极具竞争力的性能。最后,我们将用于 TI-CL 的方法公式化,称为适配器增量持续学习(AI-CL),它是“参数高效”的卷积适配器与“计算高效”的 FTA 的结合。在 ESC-50、SpeechCommandsV2(SCv2)和 Audio-Visual Event(AVE)基准上的实验表明,我们提出的方法在保持较低计算预算的同时,能够防止 TI-CL 中的灾难性遗忘。

关键词

引用

@article{arxiv.2302.14314,
  title  = {Adapter Incremental Continual Learning of Efficient Audio Spectrogram Transformers},
  author = {Nithish Muthuchamy Selvaraj and Xiaobao Guo and Adams Kong and Bingquan Shen and Alex Kot},
  journal= {arXiv preprint arXiv:2302.14314},
  year   = {2024}
}