移动设备上的个性化语音识别
计算与语言
2016-03-15 v2 机器学习
声音
摘要
我们描述了一个大词汇量语音识别系统,其准确、低延迟,且内存和计算足迹足够小,能在 Nexus 5 Android 智能手机上比实时更快运行。我们采用量化的长短期记忆(LSTM)声学模型,以连接主义时序分类(CTC)训练,直接预测音素目标,并进一步使用基于 SVD 的压缩方案减少其内存足迹。此外,我们通过使用单一语言模型用于听写和语音命令域,采用贝叶斯插值构建,最小化内存足迹。最后,为正确处理设备特定信息,如专有名称和其他上下文依赖信息,我们向解码图注入词汇项并实时偏置语言模型。我们的系统在开放听写任务上达到 13.5% 词错误率,以比实时快七倍的中位速度运行。
引用
@article{arxiv.1603.03185,
title = {Personalized Speech recognition on mobile devices},
author = {Ian McGraw and Rohit Prabhavalkar and Raziel Alvarez and Montse Gonzalez Arenas and Kanishka Rao and David Rybach and Ouais Alsharif and Hasim Sak and Alexander Gruenstein and Francoise Beaufays and Carolina Parada},
journal= {arXiv preprint arXiv:1603.03185},
year = {2016}
}