大规模ASR中软目标与硬目标RNN-T蒸馏的比较
机器学习
2022-11-01 v2 计算与语言
声音
音频与语音处理
摘要
知识蒸馏是一种有效的机器学习技术,用于将知识从教师模型迁移到更小的学生模型,尤其在使用无标签数据时。本文中,我们关注RNN-T模型的知识蒸馏,该模型广泛应用于最先进 (SoTA) 的自动语音识别 (ASR)。具体而言,我们比较了在LibriSpeech/LibriLight公开数据集 (60k小时) 和我们的内部数据 (600k小时) 上使用软目标和硬目标蒸馏来训练大规模RNN-T模型。我们发现,当教师与学生具有不同架构时,例如大型教师模型与小型流式学生模型,硬目标更有效。另一方面,在诸如迭代大型教师训练的自训练场景中,软目标蒸馏效果更佳。对于一个具有0.6B权重的大型模型,我们使用带软目标蒸馏的Noisy Student Training在LibriSpeech上取得了新的SoTA词错误率 (WER) (在dev-other上相对提升8%)。它还使我们的生产教师模型能够持续适应新的数据域。
引用
@article{arxiv.2210.05793,
title = {Comparison of Soft and Hard Target RNN-T Distillation for Large-scale ASR},
author = {Dongseong Hwang and Khe Chai Sim and Yu Zhang and Trevor Strohman},
journal= {arXiv preprint arXiv:2210.05793},
year = {2022}
}
备注
8 pages, 2 figures