中文

具有大规模数据增强的多语言字素混合 ASR

音频与语音处理 2020-04-10 v3 计算与语言 机器学习 声音

摘要

为开发面向低资源语言的高性能 ASR,解决资源匮乏的方法包括利用多语言数据,以及通过创建声学变化来增强训练数据。本工作中我们提出一个基于字素的单一 ASR 模型,该模型在 7 种地理邻近语言上学习,使用标准的混合 BLSTM-HMM 声学模型与无格 MMI 目标。我们通过取每种语言特定字素集合的并集来构建该单一 ASR 字素集,并发现此类多语言字素混合 ASR 模型可对全部 7 种语言进行语言无关的识别,且大幅优于各单语 ASR 模型。其次,我们评估了语言内多种数据增强方案的有效性,以及它们与多语言建模的互补性。总体而言,我们表明所提出的具有多种数据增强的多语言字素混合 ASR 不仅能识别训练集内的任意语言,还带来了巨大的 ASR 性能提升。

关键词

引用

@article{arxiv.1909.06522,
  title  = {Multilingual Graphemic Hybrid ASR with Massive Data Augmentation},
  author = {Chunxi Liu and Qiaochu Zhang and Xiaohui Zhang and Kritika Singh and Yatharth Saraf and Geoffrey Zweig},
  journal= {arXiv preprint arXiv:1909.06522},
  year   = {2020}
}

备注

Accepted for publication at the 1st Joint Workshop of SLTU (Spoken Language Technologies for Under-resourced languages) and CCURL (Collaboration and Computing for Under-Resourced Languages) (SLTU-CCURL 2020)