中文

使用有限域内监督训练自回归语音识别模型

计算与语言 2022-10-28 v1 声音 音频与语音处理

摘要

自监督学习的进步显著减少了训练所需的转录音频量。然而,该领域的大部分工作都集中在朗读语音上。我们探索了对话语音领域的有限监督。虽然我们假设域内数据量有限,但我们使用开源的朗读语音数据来增强模型。XLS-R模型已被证明在有限的适应数据下表现良好,并作为一个强大的基线。我们在自回归编码器-解码器模型中使用未转录的数据进行自监督学习和半监督训练。我们证明,通过使用XLS-R模型进行伪转录,当转录的域内数据有限时,一个更小的自回归模型可以优于微调后的XLS-R模型,将词错误率(WER)绝对降低多达8%。

关键词

引用

@article{arxiv.2210.15135,
  title  = {Training Autoregressive Speech Recognition Models with Limited in-domain Supervision},
  author = {Chak-Fai Li and Francis Keith and William Hartmann and Matthew Snover},
  journal= {arXiv preprint arXiv:2210.15135},
  year   = {2022}
}

备注

Submitted to IEEE ICASSP 2023