用于半监督语音识别的动量伪标注
音频与语音处理
2021-06-17 v1 机器学习
声音
摘要
伪标注(PL)已被证明在半监督自动语音识别(ASR)中是有效的,其中基模型利用从未标注数据生成的伪标签进行自训练。虽然通过随着模型演化迭代更新伪标签可进一步改进 PL,但先前大多数方法涉及低效的模型重训练或复杂的标签更新控制。我们提出动量伪标注(MPL),一种简单而有效的半监督 ASR 策略。MPL 由一对在线和离线模型组成,二者受均值教师方法启发而相互作用并相互学习。在线模型被训练以预测由离线模型即时生成的伪标签。离线模型维护在线模型的基于动量的滑动平均。MPL 在单一训练过程中执行,两模型间的交互有效帮助它们相互强化以提升 ASR 性能。我们将 MPL 应用于基于连接主义时序分类的端到端 ASR 模型。实验结果表明,MPL 有效优于基模型,并可扩展到具有不同数据量或领域失配的多种半监督场景。
引用
@article{arxiv.2106.08922,
title = {Momentum Pseudo-Labeling for Semi-Supervised Speech Recognition},
author = {Yosuke Higuchi and Niko Moritz and Jonathan Le Roux and Takaaki Hori},
journal= {arXiv preprint arXiv:2106.08922},
year = {2021}
}
备注
Accepted to Interspeech 2021