中文

利用迁移学习和语言模型解码改进非母语英语的自动语音识别

计算与语言 2022-02-11 v1 声音 音频与语音处理

摘要

为母语英语(L1)设计的自动语音识别(ASR)系统通常在非母语英语(L2)上表现不佳。为解决这一性能差距,\textbf{(i)} 我们扩展了先前的工作,在一系列丰富的 L1 和 L2 训练条件下,研究对预训练 wav2vec 2.0 模型 \cite{baevski2020wav2vec,xu2021self} 的微调。我们进一步 \textbf{(ii)} 将语言模型解码与微调方法一同整合到 ASR 系统中。分别量化这两种方法所获得的增益以及进行错误分析,使我们能够识别模型中不同的改进来源。我们发现,尽管大型自训练 wav2vec 2.0 可能内化了足够的解码知识以处理清晰的 L1 语音 \cite{xu2021self},但这并不适用于 L2 语音,并解释了在 L2 数据上使用语言模型解码的效用。

关键词

引用

@article{arxiv.2202.05209,
  title  = {Improving Automatic Speech Recognition for Non-Native English with Transfer Learning and Language Model Decoding},
  author = {Peter Sullivan and Toshiko Shibano and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2202.05209},
  year   = {2022}
}

备注

arXiv admin note: substantial text overlap with arXiv:2110.00678