从英语到更多语言:面向跨语言语音识别的参数高效模型重编程
声音
2023-06-30 v1 人工智能
机器学习
神经与进化计算
音频与语音处理
摘要
本工作中,我们提出一种基于神经模型重编程的新的参数高效学习框架,用于跨语言语音识别,其可重新利用训练良好的英语自动语音识别(ASR)模型来识别其他语言。我们设计了不同的辅助神经架构,专注于可学习的预训练特征增强,首次赋能 ASR 上的模型重编程。具体而言,我们研究如何选取基于 conformer 的 RNN-Transducer 的可训练组件(即编码器)作为冻结的预训练骨干。在七语言多语 LibriSpeech 语音(MLS)任务上的实验表明,模型重编程仅需完整 ASR 模型 4.2%(270M 中的 11M)至 6.8%(660M 中的 45M)的原始可训练参数,即可在不同语言上取得平均 WER 介于 11.9% 到 8.1% 的竞争性结果。此外,我们发现了使大规模预训练 ASR 在单语与多语语音识别中均成功的不同设置。我们的方法在更低 WER 与更优训练效率方面优于现有 ASR 微调架构及其结合自监督损失(如 w2v-bert)的扩展。
引用
@article{arxiv.2301.07851,
title = {From English to More Languages: Parameter-Efficient Model Reprogramming for Cross-Lingual Speech Recognition},
author = {Chao-Han Huck Yang and Bo Li and Yu Zhang and Nanxin Chen and Rohit Prabhavalkar and Tara N. Sainath and Trevor Strohman},
journal= {arXiv preprint arXiv:2301.07851},
year = {2023}
}
备注
Submitted to ICASSP 2023. The project was initiated in May 2022 during a research internship at Google Research