中文

结合语言模型融合的最小词错率训练用于端到端语音识别

音频与语音处理 2021-06-07 v1 人工智能 计算与语言 机器学习 声音

摘要

将外部语言模型(LM)集成到端到端(E2E)模型中仍是领域自适应语音识别的一项挑战。近期,基于内部语言模型估计(ILME)的 LM 融合通过在集束搜索中从 E2E 模型与外部 LM 分数插值里减去加权的内部 LM 分数,相比浅融合显著降低了词错率(WER)。然而,在不同测试集上,最优 LM 插值权重变化范围很大,必须在高度匹配的验证集上广泛调优。本工作中,我们在 E2E 模型的最小 WER(MWER)训练中执行 LM 融合,从而避免推理时对 LM 权重调优的需求。除采用浅融合的 MWER 训练(MWER-SF)外,我们提出一种新颖的采用 ILME 的 MWER 训练(MWER-ILME),其中基于 ILME 的融合用于生成 N-best 假设及其后验概率。当内部 LM 参与 MWER-ILME 损失计算时,会产生额外的梯度。推理时,MWER 训练中预先确定的 LM 权重可在不同领域测试集上实现鲁棒的 LM 集成。基于 30K 小时训练的 transformer transducers 实验表明,在 6 个不同测试集上,MWER-ILME 相比 MWER 与 MWER-SF 训练分别平均实现了 8.8% 与 5.8% 的相对 WER 降低。

关键词

引用

@article{arxiv.2106.02302,
  title  = {Minimum Word Error Rate Training with Language Model Fusion for End-to-End Speech Recognition},
  author = {Zhong Meng and Yu Wu and Naoyuki Kanda and Liang Lu and Xie Chen and Guoli Ye and Eric Sun and Jinyu Li and Yifan Gong},
  journal= {arXiv preprint arXiv:2106.02302},
  year   = {2021}
}

备注

5 pages, Interspeech 2021