利用纯文本数据对端到端语音识别进行内部语言模型自适应
计算与语言
2022-11-01 v5 人工智能
机器学习
声音
音频与语音处理
摘要
端到端(E2E)模型的纯文本自适应对自动语音识别(ASR)而言仍是一项挑战性任务。基于语言模型(LM)融合的方法在推理时需要额外的外部LM,显著增加了计算成本。为克服此问题,我们提出利用纯文本数据对E2E模型进行内部语言模型自适应(ILMA)。E2E模型经音频-转写对训练后,隐式学习一个表征词符序列概率的内部LM,该概率由编码器贡献置零后的E2E模型输出近似。在ILMA期间,我们微调内部LM,即不含编码器的E2E组件,以最小化交叉熵损失。为使ILMA有效,除标准E2E损失外,以内部LM损失训练E2E模型至关重要。此外,我们提出通过最小化自适应与未自适应内部LM输出分布间的Kullback-Leibler散度来正则化ILMA。当我们仅更新联合网络的最后线性层时,ILMA最为有效。ILMA能够在无需增加运行时计算成本的情况下,实现E2E模型的快速纯文本自适应。基于30K小时训练的transformer transducer模型实验,ILMA相较未自适应基线实现了最高34.9%的相对词错率降低。
引用
@article{arxiv.2110.05354,
title = {Internal Language Model Adaptation with Text-Only Data for End-to-End Speech Recognition},
author = {Zhong Meng and Yashesh Gaur and Naoyuki Kanda and Jinyu Li and Xie Chen and Yu Wu and Yifan Gong},
journal= {arXiv preprint arXiv:2110.05354},
year = {2022}
}
备注
5 pages, in Interspeech 2022