大规模流式ASR的半监督学习技术比较
计算与语言
2023-04-24 v1 声音
音频与语音处理
摘要
在无大型标注语料情况下,非配对文本与音频注入已成为提升ASR性能的主流方法。然而,关于部署这些方法以改进在以下现实约束下训练的生产级ASR系统——如受限模型规模与CPU预算、流式能力,以及用于重打分和下游NLU任务的丰富格(lattice)——的指导甚少。本工作中,我们在联合训练的可控设定下比较了三种涵盖非配对文本与音频及其若干组合的SOTA半监督方法。我们发现,在我们的设定中,这些方法带来了原始词错率(WER)之外的诸多改进,包括长尾词WER、推理时解码器计算量以及格密度的显著提升。
引用
@article{arxiv.2304.11053,
title = {A Comparison of Semi-Supervised Learning Techniques for Streaming ASR at Scale},
author = {Cal Peyser and Michael Picheny and Kyunghyun Cho and Rohit Prabhavalkar and Ronny Huang and Tara Sainath},
journal= {arXiv preprint arXiv:2304.11053},
year = {2023}
}