中文

基于多任务Conformer的低资源印度语言多语种语音识别

计算与语言 2021-09-13 v2 声音 音频与语音处理

摘要

Transformer最近在机器翻译和语音识别等序列到序列应用中变得非常流行。在这项工作中,我们提出了一种基于多任务学习的Transformer模型,用于低资源印度语言的多语种语音识别。我们提出的模型由一个conformer [1]编码器和两个并行的transformer解码器组成。我们使用一个音素解码器(PHN-DEC)用于音素识别任务,以及一个字素解码器(GRP-DEC)用于预测字素序列。我们将音素识别任务视为多任务学习框架的辅助任务。我们使用联合CTC-Attention [2]训练来联合优化网络,以同时完成音素和字素识别任务。我们采用条件解码方案,在预测字素序列之前将语言信息注入模型。我们的实验表明,我们提出的方法相比先前的方法[4]可以获得显著的改进。我们还表明,我们基于conformer的双解码器方法优于基于transformer的双解码器方法和单解码器方法。最后,我们将单语种ASR模型与我们提出的多语种ASR方法进行了比较。

关键词

引用

@article{arxiv.2109.03969,
  title  = {Multilingual Speech Recognition for Low-Resource Indian Languages using Multi-Task conformer},
  author = {Krishna D N},
  journal= {arXiv preprint arXiv:2109.03969},
  year   = {2021}
}

备注

5 pages. Rejected from Interspeech 2021. arXiv admin note: substantial text overlap with arXiv:2109.03277