中文

面向大规模多语言 ASR 的端到端模型扩展

计算与语言 2021-09-14 v2 声音 音频与语音处理

摘要

跨多种语言构建 ASR 模型是一项具有挑战性的多任务学习问题,其原因在于数据差异巨大且高度不平衡。已有工作表明从高资源语言向低资源语言存在正向迁移。然而,由于异构多语言数据的干扰以及单语容量的降低,高资源语言上的性能退化现象十分常见。我们在一个 15 种语言的任务上进行了容量研究,每种语言的数据量从 7.6K 到 53.5K 小时不等。我们采用 GShard [1] 高效扩展至 10B 参数。经验上我们发现:(1) 扩展模型参数数量是解决容量瓶颈的有效途径——我们的 5 亿参数模型已优于单语基线,扩展至 10 亿和 100 亿参数带来了进一步的质量提升;(2) 更大的模型不仅数据效率更高,而且以 TPU 天衡量的训练成本也更低——10 亿参数模型在 34% 的训练时间内达到了 5 亿参数模型相同的准确率;(3) 在固定容量预算下,增加深度优于增加宽度,且较大的编码器优于较大的解码器;(4) 通过持续训练,它们可适配新的语言和领域。

关键词

引用

@article{arxiv.2104.14830,
  title  = {Scaling End-to-End Models for Large-Scale Multilingual ASR},
  author = {Bo Li and Ruoming Pang and Tara N. Sainath and Anmol Gulati and Yu Zhang and James Qin and Parisa Haghani and W. Ronny Huang and Min Ma and Junwen Bai},
  journal= {arXiv preprint arXiv:2104.14830},
  year   = {2021}
}

备注

ASRU 2021