中文

面向低资源印度语言码切换语音识别的平衡端到端单语预训练

计算与语言 2022-02-16 v2 声音 音频与语音处理

摘要

设计码切换(CS) ASR的成功通常依赖于可用转录CS资源。这种依赖性损害了如孟加拉语和印地语等低资源语言中ASR的发展。本文中,我们利用迁移学习方法,使用不同的单语语音数据和一小部分含噪CS数据,为这两组低资源语言对设计端到端(E2E) CS ASR系统。我们按两步训练CS-ASR:(i) 使用基于卷积增强变换器(Conformer)的声学模型和n-gram语言模型构建鲁棒的双语ASR系统,以及(ii) 用有限的含噪CS数据微调整个E2E ASR。我们在MUCS 2021挑战赛上测试了我们的方法,并在CS赛道获得第3名。随后我们使用为印地语-英语和孟加拉语-英语对发布的含噪CS数据(来自低资源印度语言多语与码切换ASR挑战赛(MUCS 2021))测试所提方法,并在CS赛道获得第3名。不同于受益于爬取YouTube和学习音译对的前两名系统,我们提出的迁移学习方法专注于仅使用有限的CS数据,无需数据清洗或数据重分割。我们的方法在印地语-英语上实现了14.1%的词错误率(WER)相对提升,在孟加拉语-英语上实现了27.1%。我们提供了关于使用有限数据微调基于自注意力的ASR模型的详细指南。此外,我们发布了本文中使用的代码与配方。

关键词

引用

@article{arxiv.2106.05885,
  title  = {Balanced End-to-End Monolingual pre-training for Low-Resourced Indic Languages Code-Switching Speech Recognition},
  author = {Amir Hussein and Shammur Chowdhury and Najim Dehak and Ahmed Ali},
  journal= {arXiv preprint arXiv:2106.05885},
  year   = {2022}
}