中文

用预训练语音模型改进低资源语音识别:继续预训练与半监督训练的比较

计算与语言 2022-07-05 v1 机器学习

摘要

基于自监督 Transformer 的模型,如 wav2vec 2.0 和 HuBERT,已在自动语音识别(ASR)的现有方法上取得显著改进。这一点在基于 wav2vec 2.0 的预训练 XLSR-53 模型用可用标注数据微调后在多种语言上的表现中显而易见。然而,微调这些模型的性能可能依赖于预训练数据集中包含的语内或近似语内数据的数量。在本文中,我们研究了在多种低资源语言上对 XLSR-53 预训练模型用无标注语内音频数据进行继续预训练(CoPT)。CoPT 比半监督训练(SST)(ASR 中利用无标注数据的标准方法)计算效率更高,因为它省去了对无标注数据进行伪标注的需要。我们表明 CoPT 得到的词错误率(WER)等于或略优于使用 SST。此外,我们表明使用 CoPT 模型进行伪标注,并在 SST 中使用这些标签,可进一步改进 WER。

关键词

引用

@article{arxiv.2207.00659,
  title  = {Improving Low-Resource Speech Recognition with Pretrained Speech Models: Continued Pretraining vs. Semi-Supervised Training},
  author = {Mitchell DeHaven and Jayadev Billa},
  journal= {arXiv preprint arXiv:2207.00659},
  year   = {2022}
}

备注

Submitted to Interspeech 2022