ELP-适配器:用于各种语音处理任务的参数高效适配调优
计算与语言
2024-08-01 v1 人工智能
机器学习
声音
音频与语音处理
摘要
自监督学习已成为从语音数据中学习通用表征的关键方法。尽管在语音识别、说话人验证和情感识别等下游任务中取得了令人期待的结果,但需要大量参数,这使得针对每个任务的微调在内存上效率低下。为此,我们提出了 ELP-适配器调优方法,这是一种用于参数高效微调的新方法,包含三种类型的适配器,即编码器适配器(E-适配器)、层适配器(L-适配器)和提示适配器(P-适配器)。E-适配器集成到基于Transformer的编码器层中,帮助学习针对语音识别有效的细粒度语音表征。L-适配器创建从每个编码器层到下游头部的路径,帮助从编码器底层提取针对说话人验证和情感识别有效的非语言特征。P-适配器将伪特征附加到CNN特征上,以进一步提高其有效性和效率。通过这些适配器,模型可以快速适应各种语音处理任务。我们在五个 Backbone 模型上对四个下游任务进行评估,证明了所提方法的有效性。以 WavLM 为 Backbone 时,其性能在所有任务上都与或优于完整微调,同时只需 90% 的可学习参数。
引用
@article{arxiv.2407.21066,
title = {ELP-Adapters: Parameter Efficient Adapter Tuning for Various Speech Processing Tasks},
author = {Nakamasa Inoue and Shinta Otake and Takumi Hirose and Masanari Ohi and Rei Kawakami},
journal= {arXiv preprint arXiv:2407.21066},
year = {2024}
}