中文

利用大规模师生训练构建端侧声学模型

声音 2021-06-14 v1 机器学习 音频与语音处理

摘要

我们展示了 Alexa 语音团队在声学模型(AM)半监督学习(SSL)上的结果,实验耗费超过 3000 小时的 GPU 时间,使我们的研究成为同类中规模最大的之一。我们讨论了小 footprint 设定下声学模型的 SSL,表明使用 100 万小时无监督数据训练的较小容量模型可比基线监督系统实现 14.3% 的词错误率降低(WERR)。当监督数据增加至七倍时,我们的增益降至 7.1% WERR;为在更大监督数据规模下提升 SSL 效率,我们采用逐步蒸馏至更小模型的方法,获得了 14.4% 的 WERR。随后我们转向在低数据规模下使用更大学生模型进行 SSL;虽然无监督数据的学习效率更高,但在此设定下学生模型可能优于教师模型。我们给出了一个理论草图来解释这一行为。

关键词

引用

@article{arxiv.2106.06126,
  title  = {Exploiting Large-scale Teacher-Student Training for On-device Acoustic Models},
  author = {Jing Liu and Rupak Vignesh Swaminathan and Sree Hari Krishnan Parthasarathi and Chunchuan Lyu and Athanasios Mouchtaris and Siegfried Kunzmann},
  journal= {arXiv preprint arXiv:2106.06126},
  year   = {2021}
}

备注

TSD2021