中文

JEIT:用于语音识别的联合端到端模型与内部语言模型训练

音频与语音处理 2023-02-20 v1 人工智能 计算与语言 机器学习 声音

摘要

我们提出JEIT,一种联合端到端(E2E)模型与内部语言模型(ILM)训练方法,在E2E训练期间将大规模无配对文本注入ILM,从而改善罕见词语音识别。借助JEIT,E2E模型在音频-转录对上计算E2E损失,而其ILM在无配对文本上估计交叉熵损失。E2E模型被训练以最小化E2E损失与ILM损失的加权和。在JEIT期间,ILM从无配对文本吸收知识,而E2E训练起到正则化作用。与ILM自适应方法不同,JEIT不需要单独的自适应步骤,并避免了对ILM的Kullback-Leibler散度正则化需求。我们还表明,在JEIT框架下模块化混合自回归转导器(MHAT)比HAT表现更好,且在ILM自适应期间比HAT鲁棒得多。为推进无配对文本注入的极限,我们进一步提出联合JEIT与JOIST训练(CJJT),其受益于模态匹配、编码器文本注入与ILM训练。JEIT与CJJT均可促成更有效的LM融合。借助100B无配对句子,JEIT/CJJT相较无无配对文本训练的模型将罕见词识别准确率提升高达16.4%。

关键词

引用

@article{arxiv.2302.08583,
  title  = {JEIT: Joint End-to-End Model and Internal Language Model Training for Speech Recognition},
  author = {Zhong Meng and Weiran Wang and Rohit Prabhavalkar and Tara N. Sainath and Tongzhou Chen and Ehsan Variani and Yu Zhang and Bo Li and Andrew Rosenberg and Bhuvana Ramabhadran},
  journal= {arXiv preprint arXiv:2302.08583},
  year   = {2023}
}

备注

5 pages, 3 figures, in ICASSP 2023