使用集成模型和多阶段训练的渐进式无监督域自适应语音识别
音频与语音处理
2024-02-08 v1
摘要
在自动语音识别(ASR)中,教师-学生(T/S)训练在少量训练数据的域自适应中表现良好。然而,在没有真实标签的情况下进行自适应仍然具有挑战性。先前的研究表明,在T/S训练中使用集成教师模型进行无监督域自适应(UDA)是有效的,但其性能仍落后于在域内数据上训练的模型。本文提出了一种通过使用集成教师模型训练多阶段学生模型来获得更好UDA的方法。最初,多个教师模型在来自朗读和会议领域的标记数据上训练。这些教师用于在未标记的域外电话语音数据上训练学生模型。为了改进自适应,后续的学生模型依次训练,将先前训练的模型视为其教师。实验使用三个教师模型(在AMI、WSJ和LibriSpeech上训练)和三个阶段的学生模型(在SwitchBoard数据上)进行。在eval00测试集上的结果显示,多阶段训练在每个阶段分别取得了9.8%、7.7%和3.3%的绝对词错误率(WER)改进。
引用
@article{arxiv.2402.04805,
title = {Progressive unsupervised domain adaptation for ASR using ensemble models and multi-stage training},
author = {Rehan Ahmad and Muhammad Umar Farooq and Thomas Hain},
journal= {arXiv preprint arXiv:2402.04805},
year = {2024}
}