用于设备上高效语音域自适应的增量逐层自监督学习
声音
2021-10-04 v1 机器学习
音频与语音处理
摘要
流式端到端语音识别模型已广泛应用于移动设备,并在效率上表现出显著提升。这些模型通常在服务器端使用转写语音数据训练。然而,服务器数据分布可能与用户设备上的数据分布差异很大,从而影响模型性能。设备端训练面临两个主要挑战:可靠的标签有限以及训练内存有限。虽然自监督学习算法可利用无标签数据缓解域间失配,但由于内存限制,它们无法直接应用于移动设备。本文中,我们提出一种增量逐层自监督学习算法,用于移动设备上高效的语音域自适应,其中每次仅更新一层。大量实验结果表明,所提算法在目标域上取得的词错误率 (WER) 比监督基线好 ,且比端到端自监督学习算法节省 的训练内存。
引用
@article{arxiv.2110.00155,
title = {Incremental Layer-wise Self-Supervised Learning for Efficient Speech Domain Adaptation On Device},
author = {Zhouyuan Huo and Dongseong Hwang and Khe Chai Sim and Shefali Garg and Ananya Misra and Nikhil Siddhartha and Trevor Strohman and Françoise Beaufays},
journal= {arXiv preprint arXiv:2110.00155},
year = {2021}
}
备注
5 pages