RNN-Transducer 预测网络的快速纯文本域自适应
计算与语言
2021-06-10 v2 声音
音频与语音处理
摘要
将端到端语音识别系统自适应到新任务已知具有挑战性。已提出多种解决方案,应用外部语言模型及各种融合方法,可能结合两遍解码。也有使用 TTS 系统为端到端模型生成自适应数据。本文中我们展示 RNN-transducer 模型可仅使用少量文本数据有效自适应到新域。通过利用模型固有结构,将预测网络解释为一个语言模型,我们可对模型应用快速自适应。自适应模型避免了复杂的解码时融合和外部语言模型的需要。使用适当的正则化,预测网络可自适应到新域同时仍保持良好的泛化能力。我们通过多个 ASR 评估任务展示该方法如何在目标任务 WER 上提供 10-45% 的相对提升。我们也分享了关于 RNN-transducer 预测网络作为语言模型表现的见解。
引用
@article{arxiv.2104.11127,
title = {Fast Text-Only Domain Adaptation of RNN-Transducer Prediction Network},
author = {Janne Pylkkönen and Antti Ukkonen and Juho Kilpikoski and Samu Tamminen and Hannes Heikinheimo},
journal= {arXiv preprint arXiv:2104.11127},
year = {2021}
}
备注
5 pages, 2 figures. Accepted to Interspeech 2021