提升端到端 ASR 在数值序列上的性能
音频与语音处理
2019-07-03 v1 机器学习
声音
机器学习
摘要
识别书写域数值语音(例如 I need $1.25.)对 ASR 系统可能具有挑战性,特别是当训练期间未见到数值序列时。这一词汇外(OOV)问题在常规 ASR 系统中通过在与 spoken 域语音(例如 I need one dollar and twenty five cents.)上训练模型的一部分来解决,后者数值序列由词汇内数字组成,然后使用 FST verbalizer 将结果反规范化。遗憾的是,常规 ASR 模型不适用于设备端语音识别的低内存设定。诸如 RNN-T 的 E2E 模型对设备端 ASR 颇具吸引力,因为它们将常规模型的 AM、PM 和 LM 折叠为一个神经网络。然而,在设备端设定下,FST 反规范化器的大内存占用使 spoken 域训练更加困难。在本文中,我们研究提升 E2E 模型在数值数据上性能的技术。我们发现,使用文本到语音系统生成额外的数值训练数据,以及使用小内存神经网络执行 spoken 到书写域反规范化,可在若干数值类别上带来改进。对于最长的数值序列,我们观察到 WER 降低达 8 倍。
引用
@article{arxiv.1907.01372,
title = {Improving Performance of End-to-End ASR on Numeric Sequences},
author = {Cal Peyser and Hao Zhang and Tara N. Sainath and Zelin Wu},
journal= {arXiv preprint arXiv:1907.01372},
year = {2019}
}