中文

用于低资源语言语音识别的多语言 Transformer 语言模型

计算与语言 2022-09-12 v1

摘要

由于(1)低资源语言中的数据稀缺,(2)训练和刷新 100 多个单语模型的昂贵计算成本,以及(3)考虑到稀疏流量的托管低效,训练和部署用于混合语音识别第二遍重排序的 Transformer LM 具有挑战性。在本研究中,我们提出了一种将多个低资源区域分组并优化多语言 Transformer LM 在 ASR 中性能的新方法。我们的区域分组多语言 Transformer LM 优于传统多语言 LM,同时降低了维护成本与运营开支。此外,对于可部署单语模型但流量高的低资源区域,我们表明微调我们的区域分组多语言 LM 产生的单语 LM 候选优于基线单语 LM。

关键词

引用

@article{arxiv.2209.04041,
  title  = {Multilingual Transformer Language Model for Speech Recognition in Low-resource Languages},
  author = {Li Miao and Jian Wu and Piyush Behre and Shuangyu Chang and Sarangarajan Parthasarathy},
  journal= {arXiv preprint arXiv:2209.04041},
  year   = {2022}
}