中文

用于高效语言模型自适应的因子化神经转导器

计算与语言 2021-10-19 v5 音频与语音处理

摘要

近年来,基于端到端(E2E)的自动语音识别(ASR)系统因其简洁性与良好性能而取得巨大成功。基于 Neural Transducer 的模型在流式 E2E ASR 系统中日益流行,并有报道称其在某些场景下优于传统混合系统。然而,Neural Transducer 中声学模型、词典与语言模型的联合优化也为利用纯文本进行语言模型自适应带来了挑战。这一缺陷可能阻碍其在实际中的潜在应用。为解决此问题,本文提出一种新颖模型——因子化神经转导器(factorized neural Transducer),通过分解空白与词表预测,并为词表预测采用独立语言模型。期望此种因子化能将独立语言模型的改进迁移至转导器以用于语音识别,从而允许应用多种语言模型自适应技术。我们证明,当使用域外文本数据进行语言模型自适应时,所提因子化神经转导器带来了 15% 至 20% 的 WER 提升,代价是在通用测试集上 WER 有轻微下降。

关键词

引用

@article{arxiv.2110.01500,
  title  = {Factorized Neural Transducer for Efficient Language Model Adaptation},
  author = {Xie Chen and Zhong Meng and Sarangarajan Parthasarathy and Jinyu Li},
  journal= {arXiv preprint arXiv:2110.01500},
  year   = {2021}
}