迈向语言通用的端到端语音识别
计算与语言
2017-11-08 v1
摘要
构建多语言语音识别器通常涉及到为每种语言复制单语训练方案,或利用多任务学习方法,其中不同语言的模型具有独立的输出标签但共享某些内部参数。在本工作中,我们利用端到端语音识别的最新进展,创建一个单一的多语言语音识别系统,能够识别训练中所见任意语言。为此,我们提出使用在所有语言间共享的通用字符集。我们还在网络内创建了语言特定的门控机制,能以语言特定的方式调节网络的内部表示。我们在微软 Cortana 任务上跨三种语言评估了所提方法,并表明我们的系统优于独立的单语系统以及采用多任务学习方法构建的系统。我们还表明该模型可用于初始化单语语音识别器,并可用于创建用于语码转换场景的双语模型。
引用
@article{arxiv.1711.02207,
title = {Towards Language-Universal End-to-End Speech Recognition},
author = {Suyoun Kim and Michael L. Seltzer},
journal= {arXiv preprint arXiv:1711.02207},
year = {2017}
}
备注
submitted to ICASSP 2018