中文

神经转导器内部语言模型与序列判别训练的关系

声音 2024-04-16 v2 计算与语言 机器学习 音频与语音处理

摘要

内部语言模型(ILM)减法已被广泛应用于通过外部语言模型(LM)融合来提升RNN-Transducer在语音识别中的性能。本工作中,我们从理论和经验两个角度表明序列判别训练与ILM减法有很强的相关性。理论上,我们推导出最大互信息(MMI)训练的全局最优解与ILM减法具有相似的公式。在经验上,我们表明在Librispeech上的广泛实验中,ILM减法和序列判别训练实现了相似的效果,包括MMI和最小贝叶斯风险(MBR)准则,以及全上下文和有限上下文的神经转导器与LM。序列判别训练后,ILM减法的收益也变得小得多。我们还提供了深入研究,表明序列判别训练对常用的零编码器ILM估计影响极小,但对编码器以及预测+联合网络具有联合效应,用于后验概率重塑,包括ILM和空白抑制。

关键词

引用

@article{arxiv.2309.14130,
  title  = {On the Relation between Internal Language Model and Sequence Discriminative Training for Neural Transducers},
  author = {Zijian Yang and Wei Zhou and Ralf Schlüter and Hermann Ney},
  journal= {arXiv preprint arXiv:2309.14130},
  year   = {2024}
}

备注

accepted at ICASSP 2024