一种用于预训练通用语音模型的阿拉伯方言识别的参数高效学习方法
计算与语言
2023-10-05 v2 人工智能
机器学习
神经与进化计算
音频与语音处理
摘要
在这项工作中,我们探索参数高效学习(PEL)技术,将通用语音(GSM)模型改造用于阿拉伯方言识别(ADI)。具体而言,我们研究了在冻结预训练设置下,将可训练特征纳入多层编码器-解码器 GSM 公式的不同配置。我们的架构包括残差适配器和模型重编程(输入提示)。我们设计了一种词元级标签映射,以调节 GSM 用于阿拉伯方言识别(ADI)。由于众多地区方言在词汇和发音上的高度差异,这是具有挑战性的。我们通过原始微调在 ADI-17 数据集上取得了新的最先进准确率。我们进一步以 PEL 方法减少训练开销,该方法仅使用 2.5% 的(额外)网络可训练参数,其准确率在微调的 1.86% 以内。我们的研究展示了如何使用小数据集和有限计算资源,借助开源代码和预训练模型来识别阿拉伯方言。
引用
@article{arxiv.2305.11244,
title = {A Parameter-Efficient Learning Approach to Arabic Dialect Identification with Pre-Trained General-Purpose Speech Model},
author = {Srijith Radhakrishnan and Chao-Han Huck Yang and Sumeer Ahmad Khan and Narsis A. Kiani and David Gomez-Cabrero and Jesper N. Tegner},
journal= {arXiv preprint arXiv:2305.11244},
year = {2023}
}
备注
Accepted to Interspeech 2023, 5 pages. Code is available at: https://github.com/Srijith-rkr/KAUST-Whisper-Adapter under MIT license