大规模多语言ASR:50种语言,1个模型,10亿参数
音频与语音处理
2020-07-09 v2 计算与语言
声音
摘要
我们研究为多种语言训练单一声学模型,旨在改善低资源语言上的自动语音识别(ASR)性能,并整体简化支持多样语言的ASR系统部署。我们在51种语言上进行了广泛基准测试,各语言训练数据量不同(从100小时到1100小时)。我们比较了多语言训练的三种变体:从不知输入语言的单一联合模型,到使用该语言信息,再到多头部(每语言簇一个)。我们展示对多种语言进行ASR模型的多语言训练可改善识别性能,尤其在低资源语言上。相较于单语言基线,我们在联合模型、带语言输入的联合模型和多头部模型上分别看到20.9%、23%和28.8%的平均WER相对降低。据我们所知,这是首项在大规模上研究多语言ASR的工作,涵盖超过50种语言及其中超过16,000小时音频。
引用
@article{arxiv.2007.03001,
title = {Massively Multilingual ASR: 50 Languages, 1 Model, 1 Billion Parameters},
author = {Vineel Pratap and Anuroop Sriram and Paden Tomasello and Awni Hannun and Vitaliy Liptchinsky and Gabriel Synnaeve and Ronan Collobert},
journal= {arXiv preprint arXiv:2007.03001},
year = {2020}
}