中文

语言无关的多语言建模

音频与语音处理 2020-04-22 v1 声音 机器学习

摘要

多语言自动语音识别(ASR)系统允许在单一模型中联合训练数据丰富和数据稀缺的语言。这使得跨语言的数据和参数共享成为可能,这对数据稀缺的语言尤为有利。然而,大多数 SOTA 多语言模型需要编码语言信息,因此在扩展到新语言时不够灵活或可扩展。语言无关的多语言模型有助于解决这一问题,并且更适合多种语言经常混合使用的多元文化社会(但通常以不同的书写系统呈现)。在本文中,我们提出了一种构建语言无关多语言 ASR 系统的新方法,该方法通过多对一音译转换器将所有语言转换为一种书写系统。因此,发音相似的声学特征被映射到单一、规范的字素目标序列,从而有效分离了建模与渲染问题。我们以四种印度语系语言(即印地语、孟加拉语、泰米尔语和卡纳达语)为例表明,与语言相关的多语言模型相比,语言无关的多语言模型在词错率(WER)上实现了高达 10% 的相对降低。

关键词

引用

@article{arxiv.2004.09571,
  title  = {Language-agnostic Multilingual Modeling},
  author = {Arindrima Datta and Bhuvana Ramabhadran and Jesse Emond and Anjuli Kannan and Brian Roark},
  journal= {arXiv preprint arXiv:2004.09571},
  year   = {2020}
}