中文

具有联合语言识别的流式端到端双语 ASR 系统

音频与语音处理 2020-07-09 v1 计算与语言 声音

摘要

多语言 ASR 技术简化了模型训练与部署,但其精度已知依赖于运行时语言信息的可用性。由于在实际场景中语言身份很少事先已知,必须以最小延迟实时推断。此外,在语音激活的智能助手系统中,语言身份也是 ASR 输出下游处理所必需的。在本文中,我们介绍了使用循环神经网络转导器(RNN-T)架构同时执行 ASR 与语言识别(LID)的流式、端到端双语系统。在输入侧,来自预训练纯声学 LID 分类器的嵌入用于引导 RNN-T 的训练与推理,而在输出侧,语言目标与 ASR 目标联合建模。所提方法应用于两对语言:美国境内的英语-西班牙语,以及印度境内的英语-印地语。实验表明,对于英语-西班牙语,双语联合 ASR-LID 架构与单语 ASR 及纯声学 LID 精度相当。对于更具挑战性(由于语句内语码切换)的英语-印地语情况,英语 ASR 与 LID 指标出现下降。总体而言,在用户于语言间动态切换的场景中,所提架构相较于并行运行多个单语 ASR 模型与一个 LID 分类器提供了一种有前景的简化方案。

关键词

引用

@article{arxiv.2007.03900,
  title  = {Streaming End-to-End Bilingual ASR Systems with Joint Language Identification},
  author = {Surabhi Punjabi and Harish Arsikere and Zeynab Raeesy and Chander Chandak and Nikhil Bhave and Ankish Bansal and Markus Müller and Sergio Murillo and Ariya Rastrow and Sri Garimella and Roland Maas and Mat Hans and Athanasios Mouchtaris and Siegfried Kunzmann},
  journal= {arXiv preprint arXiv:2007.03900},
  year   = {2020}
}