弱监督 ASR 中何时信任哪位教师模型的学习
音频与语音处理
2024-01-29 v1 声音
摘要
自动语音识别(ASR)训练可利用多个专家作为教师模型,每个专家在特定领域或口音上训练。教师模型本质上可能是不透明的,因为其架构可能未知,或其训练节奏与学生 ASR 模型不同。尽管如此,学生模型仍使用专家教师独立生成的伪标签进行增量更新。在本文中,我们利用多领域专家的监督来训练学生 ASR 模型。该训练策略在极少或无人声转录可用的场景下尤为有用。为此,我们提出一种 Smart-Weighter 机制,基于输入音频选择合适的专家,然后在无监督设置下训练学生模型。我们使用 LibriSpeech 和 LibriLight 基准展示了方法的有效性,并发现相比均匀加权所有专家、使用单一专家模型或通过 ROVER 组合专家的基线,有 4% 至 25% 的提升。
引用
@article{arxiv.2306.12012,
title = {Learning When to Trust Which Teacher for Weakly Supervised ASR},
author = {Aakriti Agrawal and Milind Rao and Anit Kumar Sahu and Gopinath Chennupati and Andreas Stolcke},
journal= {arXiv preprint arXiv:2306.12012},
year = {2024}
}
备注
Proceedings of INTERSPEECH 2023