中文

音频频谱 Transformer 的参数高效迁移学习

音频与语音处理 2024-07-16 v4

摘要

参数高效迁移学习(PETL)方法已成为标准全量微调方法的可靠替代方案。它们仅为每个下游任务训练少量额外参数,在不牺牲性能的同时,免去了为每个任务存储预训练模型副本的问题。对于音频分类任务,Audio Spectrogram Transformer(AST)模型展现出了出色的效果。然而,令人惊讶的是,如何将其高效地适配到多个下游任务此前尚未被探讨。在本文中,我们弥补了这一空白,并对用于将 AST 模型适配到音频/语音任务的常见 PETL 方法进行了详细研究。此外,我们提出了一种新的适配器设计,该设计利用了 Conformer 模型的卷积模块,其性能优于标准 PETL 方法,并且仅更新 0.29% 的参数即可超越或达到与全量微调相当的性能。最后,我们提供了消融实验,表明我们提出的适配器:1)在少样本高效迁移学习中被证明是有效的;2)无论分配的参数量多少都能获得最优结果;3)可应用于其他预训练模型。

关键词

引用

@article{arxiv.2312.03694,
  title  = {Parameter-Efficient Transfer Learning of Audio Spectrogram Transformers},
  author = {Umberto Cappellazzo and Daniele Falavigna and Alessio Brutti and Mirco Ravanelli},
  journal= {arXiv preprint arXiv:2312.03694},
  year   = {2024}
}

备注

Accepted at IEEE International Workshop on Machine Learning for Signal Processing (MLSP) 2024. The code is available at: https://github.com/umbertocappellazzo/PETL_AST