中文

端侧端到端自动语音识别模型个性化方法研究

音频与语音处理 2019-09-17 v1 机器学习 声音 机器学习

摘要

使用来自多名用户的数据训练得到的说话人无关语音识别系统通常对说话人差异具有鲁棒性,并能很好地服务于大量说话人。然而,这些系统对于语音特征差异极大的用户并不总是能很好地泛化。这一问题可通过构建为每位特定用户设计、表现良好的个性化系统来解决。在本文中,我们研究了在移动设备上安全地训练个性化端到端语音识别模型的思路,使得用户数据和模型从不离开设备,也从不存储在服务器上。我们通过模拟端侧数据消耗来研究移动训练环境对性能的影响。我们利用从语音障碍用户处收集的数据进行个性化实验。我们的结果表明,在服务器环境下训练可实现 63.7% 的相对词错误率降低,在移动环境下为 58.1%。转向端侧个性化导致了 18.7% 的性能下降,以换取更好的可扩展性与数据隐私。为在设备上训练模型,我们将梯度计算一分为二,以训练时间增加 42% 为代价实现了 45% 的内存减少。

关键词

引用

@article{arxiv.1909.06678,
  title  = {An Investigation Into On-device Personalization of End-to-end Automatic Speech Recognition Models},
  author = {Khe Chai Sim and Petr Zadrazil and Françoise Beaufays},
  journal= {arXiv preprint arXiv:1909.06678},
  year   = {2019}
}