中文

伪标签优于人工标签

机器学习 2022-07-05 v3 计算与语言

摘要

最先进的自动语音识别 (ASR) 系统使用数万小时的标注语音数据进行训练。人工转写昂贵且耗时。转写的质量与一致性等因素会极大影响使用这些数据训练的 ASR 模型性能。本文中,我们展示了可利用近期自监督与半监督学习技术训练一个强教师模型来生成高质量伪标签。具体而言,我们使用 JUST (联合无监督/有监督训练) 与迭代噪声学生-教师训练来训练一个 6 亿参数的双向教师模型。该模型在语音搜索任务上达到了 4.0% 的词错误率 (WER),相对优于基线 11.1%。我们进一步表明,通过使用该强教师模型生成高质量伪标签进行训练,相比使用人工标签,我们能为流式模型实现 13.6% 的相对 WER 降低(从 5.9% 到 5.1%)。

关键词

引用

@article{arxiv.2203.12668,
  title  = {Pseudo Label Is Better Than Human Label},
  author = {Dongseong Hwang and Khe Chai Sim and Zhouyuan Huo and Trevor Strohman},
  journal= {arXiv preprint arXiv:2203.12668},
  year   = {2022}
}

备注

6 pages, 2 figures, 9 tables, Proceedings of INTERSPEECH 2022