面向因子化 transducer 模型的有效内部语言模型训练与融合
音频与语音处理
2024-04-03 v1 人工智能
计算与语言
机器学习
摘要
神经 transducer 的内部语言模型 (ILM) 已广泛研究。在大多数 prior 工作中,ILM 主要用于估计 ILM 分数,并在推理时从该分数中减去,以促进与外部语言模型的集成。最近,提出了各种因子化 transducer 模型,这些模型显式地接受用于非空标记预测的独立内部语言模型。然而,即便采用因子化 transducer 模型,与浅层融合的改进仍有限。本文提出了一种针对因子化 transducer 模型的新型 ILM 训练与解码策略,有效地将空白、声学和 ILM 分数组合。我们的实验表明,在 LibriSpeech 数据集上利用经过良好训练的 ILM 和本文提出的解码策略,相较于标准解码方法可实现 17% 的相对改进。此外,与增强了外部 LM 融合的强 RNN-T 基线相比,本文提议的模型在 general-sets 上实现 5.5% 的相对改进,在罕见词上实现 8.9% 的 WER 降低。该模型无需依赖外部语言模型即可实现卓越性能,因而在实际应用场景中具有高度效率。为进一步提升性能,我们提出了一种新型且内存高效的 ILM-融合感知的最小词错误率 (MWER) 训练方法,该方法显著改善了 ILM 的集成。
引用
@article{arxiv.2404.01716,
title = {Effective internal language model training and fusion for factorized transducer model},
author = {Jinxi Guo and Niko Moritz and Yingyi Ma and Frank Seide and Chunyang Wu and Jay Mahadeokar and Ozlem Kalinli and Christian Fuegen and Mike Seltzer},
journal= {arXiv preprint arXiv:2404.01716},
year = {2024}
}
备注
Accepted to ICASSP 2024