中文

通过多域训练改进口音语音识别

机器学习 2023-03-15 v1 计算与语言 声音 音频与语音处理

摘要

得益于自监督学习的兴起,自动语音识别(ASR)系统如今在多种数据集上达到了接近人类的表现。然而,它们仍缺乏泛化能力,且对如口音变化等域偏移不够鲁棒。在这项工作中,我们使用代表四种不同法语口音的语音音频来创建微调数据集,以提升预训练 ASR 模型的鲁棒性。通过在训练集中纳入多种口音,我们获得了域内与域外的双重改进。我们的数值实验表明,与单域训练相比,我们能在非洲和比利时口音上将错误率相对降低至多 25%,同时在标准法语上保持良好性能。

关键词

引用

@article{arxiv.2303.07924,
  title  = {Improving Accented Speech Recognition with Multi-Domain Training},
  author = {Lucas Maison and Yannick Estève},
  journal= {arXiv preprint arXiv:2303.07924},
  year   = {2023}
}

备注

5 pages, 2 figures. Accepted to ICASSP 2023