中文

用于域自适应端到端语音识别的内部语言模型训练

音频与语音处理 2021-04-26 v2 人工智能 计算与语言 机器学习 声音

摘要

使用内部语言模型估计 (ILME) 方法可显著提升外部语言模型 (LM) 与现有端到端 (E2E) 自动语音识别 (ASR) 系统集成的效能。在该方法中,推理时将 E2E 分数与外部 LM 分数插值所得分数减去内部 LM 分数。为改进基于 ILME 的推理,我们提出内部 LM 训练 (ILMT) 方法,通过仅更新影响内部 LM 估计的 E2E 模型组件来最小化额外的内部 LM 损失。ILMT 鼓励 E2E 模型在其现有组件内形成独立的 LM,且不牺牲 ASR 精度。ILMT 之后,具有匹配训练与推理准则的更模块化 E2E 模型能够更彻底地消除源域内部 LM,从而实现目标域外部 LM 更有效的集成。使用 30K 小时训练的循环神经网络转导器与基于注意力编码器-解码器模型进行实验,采用基于 ILME 推理的 ILMT 相较于标准 E2E 训练结合浅融合 (Shallow Fusion),在域外 LibriSpeech 与域内 Microsoft 生产测试集上分别实现了高达 31.5% 与 11.4% 的相对词错率降低。

关键词

引用

@article{arxiv.2102.01380,
  title  = {Internal Language Model Training for Domain-Adaptive End-to-End Speech Recognition},
  author = {Zhong Meng and Naoyuki Kanda and Yashesh Gaur and Sarangarajan Parthasarathy and Eric Sun and Liang Lu and Xie Chen and Jinyu Li and Yifan Gong},
  journal= {arXiv preprint arXiv:2102.01380},
  year   = {2021}
}

备注

5 pages, ICASSP 2021