使用单一端到端模型的多语种语音识别
音频与语音处理
2018-02-16 v2 人工智能
计算与语言
摘要
训练一个支持多种语言的常规自动语音识别(ASR)系统颇具挑战,因为子词单元、词典与词表通常具有语言特异性。相比之下,序列到序列模型非常适于多语种 ASR,因为它们将声学、发音与语言模型联合封装于单一网络中。本文给出一个在 9 种不同印度语言上训练的单一序列到序列 ASR 模型,这些语言的文字几乎无重叠。具体而言,我们取各语言特定字形集之并,并在所有语言数据上联合训练一个基于字形的序列到序列模型。我们发现,该模型在未显式给定任何语言身份信息的情况下,相较各语言单独训练的同类序列到序列模型相对提升 21% 识别性能。通过修改模型以接受语言标识符作为额外输入特征,我们进一步相对提升 7% 并消除了不同语言间的混淆。
引用
@article{arxiv.1711.01694,
title = {Multilingual Speech Recognition With A Single End-To-End Model},
author = {Shubham Toshniwal and Tara N. Sainath and Ron J. Weiss and Bo Li and Pedro Moreno and Eugene Weinstein and Kanishka Rao},
journal= {arXiv preprint arXiv:1711.01694},
year = {2018}
}
备注
Accepted in ICASSP 2018