利用大规模师生训练构建端侧声学模型
声音
2021-06-14 v1 机器学习
音频与语音处理
摘要
我们展示了 Alexa 语音团队在声学模型(AM)半监督学习(SSL)上的结果,实验耗费超过 3000 小时的 GPU 时间,使我们的研究成为同类中规模最大的之一。我们讨论了小 footprint 设定下声学模型的 SSL,表明使用 100 万小时无监督数据训练的较小容量模型可比基线监督系统实现 14.3% 的词错误率降低(WERR)。当监督数据增加至七倍时,我们的增益降至 7.1% WERR;为在更大监督数据规模下提升 SSL 效率,我们采用逐步蒸馏至更小模型的方法,获得了 14.4% 的 WERR。随后我们转向在低数据规模下使用更大学生模型进行 SSL;虽然无监督数据的学习效率更高,但在此设定下学生模型可能优于教师模型。我们给出了一个理论草图来解释这一行为。
引用
@article{arxiv.2106.06126,
title = {Exploiting Large-scale Teacher-Student Training for On-device Acoustic Models},
author = {Jing Liu and Rupak Vignesh Swaminathan and Sree Hari Krishnan Parthasarathi and Chunchuan Lyu and Athanasios Mouchtaris and Siegfried Kunzmann},
journal= {arXiv preprint arXiv:2106.06126},
year = {2021}
}
备注
TSD2021