基于神经文本生成的数据增强对形态丰富语音识别有效性的研究
音频与语音处理
2020-09-04 v1 计算与语言
声音
摘要
近年来,先进的神经网络模型已深入应用于自动语音识别(ASR),然而在语言建模方面,许多系统仍部分或完全依赖传统的回退 N 元语言模型(BNLM)。其原因在于训练和使用神经语言模型成本高且复杂,大多需要通过增加第二遍解码(重打分)来实现。在我们近期的工作中,我们通过将知识从循环神经网络语言模型(RNNLM)迁移到基于文本生成数据增强的单遍 BNLM,显著提升了对话语音转录系统的在线性能。本文中,我们分析了可迁移知识的数量,并证明神经增强语言模型(RNN-BNLM)能够捕获 RNNLM 近 50% 的知识,同时省去第二遍解码并使系统具备实时能力。我们还系统地比较了词级与子词级语言模型,表明在资源匮乏条件下,基于子词的神经文本增强尤为有益。此外,我们展示了在第一遍中使用 RNN-BNLM 并接以神经第二遍时,离线 ASR 结果甚至可得到显著改善。
引用
@article{arxiv.2006.05129,
title = {On the Effectiveness of Neural Text Generation based Data Augmentation for Recognition of Morphologically Rich Speech},
author = {Balázs Tarján and György Szaszák and Tibor Fegyó and Péter Mihajlik},
journal= {arXiv preprint arXiv:2006.05129},
year = {2020}
}
备注
8 pages, 2 figures, accepted for publication at TSD 2020