通过软混合适配器高效微调音频频谱图变换器
音频与语音处理
2024-06-05 v2 人工智能
摘要
混合专家(MoE)架构近来蓬勃发展,因其能在保持计算成本可承受的同时扩展模型容量。此外,它们可应用于变换器和状态空间模型——当前众多领域中的最先进模型。虽然MoE主要在预训练阶段得到研究,其在参数高效迁移学习设置中的使用尚不充分。为缩小这一差距,本文尝试阐明MoE在音频频谱图变换器参数高效微调中用于音频和语音下游任务的使用。具体而言,我们提出软混合适配器(Soft-MoA)。它利用适配器作为专家,并借助最近的Soft MoE方法,通过输入令牌与专家之间的软分配来限制计算时间。在4个基准上的大量实验表明,Soft-MoA优于单一适配器方法,且性能与密集MoA相当。最后,我们对Soft-MoA的关键要素进行了消融研究,例如表明Soft-MoA在更多专家时实现了更好的扩展,同时确保所有专家都参与输出令牌的计算,从而消除了专家不平衡问题。
引用
@article{arxiv.2402.00828,
title = {Efficient Fine-tuning of Audio Spectrogram Transformers via Soft Mixture of Adapters},
author = {Umberto Cappellazzo and Daniele Falavigna and Alessio Brutti},
journal= {arXiv preprint arXiv:2402.00828},
year = {2024}
}
备注
Accepted at INTERSPEECH 2024. The code is publicly available at: https://github.com/umbertocappellazzo/PETL_AST