面向多语言 ASR 的无监督与有监督联合训练
计算与语言
2021-11-17 v1 机器学习
声音
音频与语音处理
摘要
自监督训练在预训练模型及促进诸如多语言 ASR 等语音识别下游微调中展现出可观收益。多数现有方法采用两阶段方案:第一阶段优化自监督损失,第二阶段进行标准有监督微调。本文提出一种端到端(E2E)无监督与有监督联合训练(JUST)方法,将监督 RNN-T 损失与自监督对比及掩码语言建模(MLM)损失结合。我们在包含 8 种语言且极度不平衡的公开数据集 Multilingual LibriSpeech(MLS)上验证其性能。在 MLS 上,我们探索(1)从头训练的 JUST,与(2)从预训练检查点微调的 JUST。实验表明 JUST 能持续优于其他现有最优方法,并以显著优势击败单语基线,展示出 JUST 处理多语言 ASR 中低资源语言的能力。我们所有语言的平均 WER 优于平均单语基线 33.3%,优于最优两阶段 XLSR 32%。在如波兰语等低资源语言上,我们的 WER 不到单语基线的一半,甚至击败使用外部监督的有监督迁移学习方法。
引用
@article{arxiv.2111.08137,
title = {Joint Unsupervised and Supervised Training for Multilingual ASR},
author = {Junwen Bai and Bo Li and Yu Zhang and Ankur Bapna and Nikhil Siddhartha and Khe Chai Sim and Tara N. Sainath},
journal= {arXiv preprint arXiv:2111.08137},
year = {2021}
}