面向流式多语言语音识别中尾部语言的高效适配器微调
计算与语言
2024-01-18 v1 机器学习
声音
音频与语音处理
摘要
端到端自动语音识别模型在流式多语言场景中常受青睐,因其更易部署且能受益于预训练语音模型(如强大的基础模型)。然而,不同语言的异构特性与数据丰度不均衡可能导致性能下降,使不同语言在训练期间达到性能峰值的时刻异步,尾部语言尤甚。有时,因隐私保护增强,数据本身甚至可能不可用。现有工作往往大幅增加模型规模或学习语言特定解码器以分别适应每种语言。本研究探索在级联 Conformer 换能器框架下,通过教师伪标签增强的简单而有效的语言依赖适配器(Language-Dependent Adapter, LDA)微调,用于流式多语言语音识别中的尾部语言。该适配器每种语言仅占完整模型的 0.4%。它被插入冻结的基础模型,且是带噪学生训练微调过程中唯一可训练的模块。最终模型合并来自不同语言不同检查点的适配器参数。模型性能在一个具有挑战性的多语言听写数据集上得到验证,该数据集包含拉丁、希腊、阿拉伯等语系的 39 种尾部语言。我们提出的方法平均带来 12.2% 的词错误率降低,在单一语言上最高达 37.5%。此外,我们表明参数高效的语言依赖适配器可匹敌全模型微调的质量,从而极大缓解异步性能峰值问题。
引用
@article{arxiv.2401.08992,
title = {Efficient Adapter Finetuning for Tail Languages in Streaming Multilingual ASR},
author = {Junwen Bai and Bo Li and Qiujia Li and Tara N. Sainath and Trevor Strohman},
journal= {arXiv preprint arXiv:2401.08992},
year = {2024}
}
备注
Accepted to ICASSP 2024