中文

利用音素掩码训练实现抗语音弱化鲁棒的端到端维语语音识别

声音 2022-04-05 v1 音频与语音处理

摘要

在维语语音中,辅音与元音弱化经常遇到,尤其在语速较高的自发语音中,这会导致语音识别性能下降。为解决此问题,我们提出一种有效的音素掩码训练方法,用于基于 Conformer 的维语端到端(E2E)语音识别。其思想是在模型训练期间随机掩码掉一定比例的音素特征,以模拟上述言语现象并促使 E2E 模型学习更多上下文信息。据实验,上述问题可大幅缓解。此外,对掩码中不同单元进行了深入研究,显示了我们所提掩码单元的有效性。我们还进一步研究了掩码方法并优化了音素掩码的填充策略。最后,与无掩码训练的基于 Conformer 的 E2E 基线相比,我们的模型在朗读语音上相对词错误率(WER)降低约 5.51%,在自发语音上降低 12.92%。上述方法也在开源数据 THUYG-20 的测试集上得到验证,显示出 20% 的相对提升。

关键词

引用

@article{arxiv.2204.00819,
  title  = {Leveraging Phone Mask Training for Phonetic-Reduction-Robust E2E Uyghur Speech Recognition},
  author = {Guodong Ma and Pengfei Hu and Jian Kang and Shen Huang and Hao Huang},
  journal= {arXiv preprint arXiv:2204.00819},
  year   = {2022}
}

备注

Accepted by INTERSPEECH 2021