中文

用于设备上高效语音域自适应的增量逐层自监督学习

声音 2021-10-04 v1 机器学习 音频与语音处理

摘要

流式端到端语音识别模型已广泛应用于移动设备,并在效率上表现出显著提升。这些模型通常在服务器端使用转写语音数据训练。然而,服务器数据分布可能与用户设备上的数据分布差异很大,从而影响模型性能。设备端训练面临两个主要挑战:可靠的标签有限以及训练内存有限。虽然自监督学习算法可利用无标签数据缓解域间失配,但由于内存限制,它们无法直接应用于移动设备。本文中,我们提出一种增量逐层自监督学习算法,用于移动设备上高效的语音域自适应,其中每次仅更新一层。大量实验结果表明,所提算法在目标域上取得的词错误率 (WER) 比监督基线好 24.2%24.2\%,且比端到端自监督学习算法节省 89.7%89.7\% 的训练内存。

关键词

引用

@article{arxiv.2110.00155,
  title  = {Incremental Layer-wise Self-Supervised Learning for Efficient Speech Domain Adaptation On Device},
  author = {Zhouyuan Huo and Dongseong Hwang and Khe Chai Sim and Shefali Garg and Ananya Misra and Nikhil Siddhartha and Trevor Strohman and Françoise Beaufays},
  journal= {arXiv preprint arXiv:2110.00155},
  year   = {2021}
}

备注

5 pages