使用有限域内监督训练自回归语音识别模型
计算与语言
2022-10-28 v1 声音
音频与语音处理
摘要
自监督学习的进步显著减少了训练所需的转录音频量。然而,该领域的大部分工作都集中在朗读语音上。我们探索了对话语音领域的有限监督。虽然我们假设域内数据量有限,但我们使用开源的朗读语音数据来增强模型。XLS-R模型已被证明在有限的适应数据下表现良好,并作为一个强大的基线。我们在自回归编码器-解码器模型中使用未转录的数据进行自监督学习和半监督训练。我们证明,通过使用XLS-R模型进行伪转录,当转录的域内数据有限时,一个更小的自回归模型可以优于微调后的XLS-R模型,将词错误率(WER)绝对降低多达8%。
引用
@article{arxiv.2210.15135,
title = {Training Autoregressive Speech Recognition Models with Limited in-domain Supervision},
author = {Chak-Fai Li and Francis Keith and William Hartmann and Matthew Snover},
journal= {arXiv preprint arXiv:2210.15135},
year = {2022}
}
备注
Submitted to IEEE ICASSP 2023