中文

使用Wav2vec 2.0的巴西葡萄牙语语音识别

计算与语言 2021-12-23 v3

摘要

深度学习技术已被证明在各种任务中高效,特别是在语音识别系统的开发中,即旨在将音频句子转录为一系列书面单词的系统。尽管该领域取得了进展,但语音识别仍然被认为是困难的,特别是对于缺乏可用数据的语言,如巴西葡萄牙语(BP)。在此意义上,本文介绍了使用仅开放可用的音频数据开发一个公开的自动语音识别(ASR)系统,通过对预训练于多种语言的Wav2vec 2.0 XLSR-53模型在BP数据上进行微调。最终模型在7个不同数据集上的平均词错误率为12.4%(应用语言模型时为10.5%)。据我们所知,所获得的错误率是BP中开放端到端(E2E)ASR模型中的最低值。

关键词

引用

@article{arxiv.2107.11414,
  title  = {Brazilian Portuguese Speech Recognition Using Wav2vec 2.0},
  author = {Lucas Rafael Stefanel Gris and Edresson Casanova and Frederico Santos de Oliveira and Anderson da Silva Soares and Arnaldo Candido Junior},
  journal= {arXiv preprint arXiv:2107.11414},
  year   = {2021}
}