中文

Kaizen:利用指数移动平均的持续改进教师模型用于半监督语音识别

音频与语音处理 2021-10-28 v2 计算与语言

摘要

本文引入 Kaizen 框架,该框架使用持续优化的教师模型为半监督语音识别(ASR)生成伪标签。所提方法使用一个教师模型,其参数更新为学生模型参数的指数移动平均(EMA)。我们证明,EMA 以全精度浮点数累积至关重要。Kaizen 框架可视为用于半监督训练的迭代伪标注方法的连续版本。它适用于不同的训练准则,本文中我们展示了其对帧级混合隐马尔可夫模型-深度神经网络(HMM-DNN)系统以及序列级连接主义时序分类(CTC)基模型的的有效性。对于英国英语和意大利语的大规模真实世界无监督公开视频,所提方法 i) 相比标准教师-学生训练显示出超过 10% 的相对词错误率(WER)降低;ii) 仅使用 10 小时监督数据和大量无监督数据,便缩小了与分别使用 650 小时或 2700 小时的上界监督 ASR 系统的差距。

关键词

引用

@article{arxiv.2106.07759,
  title  = {Kaizen: Continuously improving teacher using Exponential Moving Average for semi-supervised speech recognition},
  author = {Vimal Manohar and Tatiana Likhomanenko and Qiantong Xu and Wei-Ning Hsu and Ronan Collobert and Yatharth Saraf and Geoffrey Zweig and Abdelrahman Mohamed},
  journal= {arXiv preprint arXiv:2106.07759},
  year   = {2021}
}

备注

Updated with camera ready version