中文

提升端到端 ASR 在数值序列上的性能

音频与语音处理 2019-07-03 v1 机器学习 声音 机器学习

摘要

识别书写域数值语音(例如 I need $1.25.)对 ASR 系统可能具有挑战性,特别是当训练期间未见到数值序列时。这一词汇外(OOV)问题在常规 ASR 系统中通过在与 spoken 域语音(例如 I need one dollar and twenty five cents.)上训练模型的一部分来解决,后者数值序列由词汇内数字组成,然后使用 FST verbalizer 将结果反规范化。遗憾的是,常规 ASR 模型不适用于设备端语音识别的低内存设定。诸如 RNN-T 的 E2E 模型对设备端 ASR 颇具吸引力,因为它们将常规模型的 AM、PM 和 LM 折叠为一个神经网络。然而,在设备端设定下,FST 反规范化器的大内存占用使 spoken 域训练更加困难。在本文中,我们研究提升 E2E 模型在数值数据上性能的技术。我们发现,使用文本到语音系统生成额外的数值训练数据,以及使用小内存神经网络执行 spoken 到书写域反规范化,可在若干数值类别上带来改进。对于最长的数值序列,我们观察到 WER 降低达 8 倍。

关键词

引用

@article{arxiv.1907.01372,
  title  = {Improving Performance of End-to-End ASR on Numeric Sequences},
  author = {Cal Peyser and Hao Zhang and Tara N. Sainath and Zelin Wu},
  journal= {arXiv preprint arXiv:1907.01372},
  year   = {2019}
}