面向大词汇量端侧语音识别的双学习
计算与语言
2023-01-12 v1 人工智能
摘要
双学习是一种半监督机器学习范式,旨在通过同时解决两个相反的任务来利用无监督数据。在该方案中,每个模型用于为无标签样本生成伪标签,以训练另一个模型。双学习已通过将 ASR 与 TTS 配对为对偶任务在语音处理中得到一些应用。然而,这些结果大多仅针对使用非配对样本弥补极小的有监督数据集的情况,且主要集中于大型非流式模型。双学习尚未被证明能利用无监督数据来改进已在大型有监督语料库上训练的现实端侧流式模型。我们通过分析一个在全部 Librispeech 上训练的端侧规模流式 conformer 提供了这一缺失环节,展示了在无语言模型时相对 WER 提升 10.7%/5.2%,在有语言模型时提升 11.7%/16.4%。
引用
@article{arxiv.2301.04327,
title = {Dual Learning for Large Vocabulary On-Device ASR},
author = {Cal Peyser and Ronny Huang and Tara Sainath and Rohit Prabhavalkar and Michael Picheny and Kyunghyun Cho},
journal= {arXiv preprint arXiv:2301.04327},
year = {2023}
}