移动设备上针对命名实体的端到端语音识别个性化
音频与语音处理
2019-12-20 v1 机器学习
声音
机器学习
摘要
我们研究了若干技术对端到端语音模型进行个性化并改善与用户相关的专有名称识别的有效性。这些技术在提供监督所需用户付出方面有所不同,并根据其对语音识别性能的影响进行评估。我们提出使用关键词相关的精确率与召回率指标来衡量词汇习得性能。我们在一个自行设计的数据集上评估这些算法,该数据集包含难以识别的人名。因此,该数据集上专有名称的基线召回率极低:2.4%。我们开发的数据合成方法将其提升至 48.6%,且无需用户提供语音输入。若有语音输入,若用户仅纠正名称,名称召回率提升至 64.4%。若用户纠正所有识别错误,我们取得最佳的 73.5% 召回率。为免除上传用户数据及在服务器上存储个性化模型的需要,我们专注于在移动设备上完成整个个性化工作流程。
引用
@article{arxiv.1912.09251,
title = {Personalization of End-to-end Speech Recognition On Mobile Devices For Named Entities},
author = {Khe Chai Sim and Françoise Beaufays and Arnaud Benard and Dhruv Guliani and Andreas Kabel and Nikhil Khare and Tamar Lucassen and Petr Zadrazil and Harry Zhang and Leif Johnson and Giovanni Motta and Lillian Zhou},
journal= {arXiv preprint arXiv:1912.09251},
year = {2019}
}