中文

利用纯文本数据对端到端语音识别进行内部语言模型自适应

计算与语言 2022-11-01 v5 人工智能 机器学习 声音 音频与语音处理

摘要

端到端(E2E)模型的纯文本自适应对自动语音识别(ASR)而言仍是一项挑战性任务。基于语言模型(LM)融合的方法在推理时需要额外的外部LM,显著增加了计算成本。为克服此问题,我们提出利用纯文本数据对E2E模型进行内部语言模型自适应(ILMA)。E2E模型经音频-转写对训练后,隐式学习一个表征词符序列概率的内部LM,该概率由编码器贡献置零后的E2E模型输出近似。在ILMA期间,我们微调内部LM,即不含编码器的E2E组件,以最小化交叉熵损失。为使ILMA有效,除标准E2E损失外,以内部LM损失训练E2E模型至关重要。此外,我们提出通过最小化自适应与未自适应内部LM输出分布间的Kullback-Leibler散度来正则化ILMA。当我们仅更新联合网络的最后线性层时,ILMA最为有效。ILMA能够在无需增加运行时计算成本的情况下,实现E2E模型的快速纯文本自适应。基于30K小时训练的transformer transducer模型实验,ILMA相较未自适应基线实现了最高34.9%的相对词错率降低。

关键词

引用

@article{arxiv.2110.05354,
  title  = {Internal Language Model Adaptation with Text-Only Data for End-to-End Speech Recognition},
  author = {Zhong Meng and Yashesh Gaur and Naoyuki Kanda and Jinyu Li and Xie Chen and Yu Wu and Yifan Gong},
  journal= {arXiv preprint arXiv:2110.05354},
  year   = {2022}
}

备注

5 pages, in Interspeech 2022