双流水线与低秩适配:多语言ASR中的新语言集成
音频与语音处理
2024-06-13 v1 计算与语言
摘要
本文解决了将新语言集成到预训练的多语言自动语音识别(mASR)系统中的挑战,特别是在现有语言训练数据有限或不可用的情况下。所提出的方法采用双流水线与低秩适应(LoRA)。它维护两个数据流动管道——一个用于现有语言,另一个用于新语言。主流水线遵循通过预训练参数的标准流程,而次流水线还额外利用由LoRA表示的语言特定参数以及独立的输出解码器模块。重要的是,所提出的方法最小化了现有语言性能的下降,并通过解码器选择策略实现了语言无关的操作模式。我们通过将预训练的Whisper模型扩展到FLEURS数据集中的19个新语言来验证了所提出方法的有效性。
引用
@article{arxiv.2406.07842,
title = {Dual-Pipeline with Low-Rank Adaptation for New Language Integration in Multilingual ASR},
author = {Yerbolat Khassanov and Zhipeng Chen and Tianfeng Chen and Tze Yuang Chong and Wei Li and Jun Zhang and Lu Lu and Yuxuan Wang},
journal= {arXiv preprint arXiv:2406.07842},
year = {2024}
}
备注
5 pages, 2 figures, 4 tables