RNN-Transducer中隐式语言模型的自适应折扣
计算与语言
2022-03-07 v1 机器学习
摘要
RNN-Transducer(RNN-T)模型已成为流式端到端 ASR 系统的代名词。尽管它们在若干评测类别上表现具竞争力,生僻词对 RNN-T 模型构成严峻挑战。性能在生僻词上退化的一个主要原因是 RNN-T 内部语言模型(LM)可能变得过度自信,并导致与底层语音声学不一致的幻觉预测。为解决此问题,我们提出一种轻量级自适应 LM 折扣技术 AdaptLMD,它可用于任何 RNN-T 架构而无需外部资源或额外参数。AdaptLMD 采用双管齐下的方法:1) 随机掩码预测网络输出,以鼓励 RNN-T 不过度依赖其输出。2) 基于最近预测词元的稀有度以及 ILM 与隐式声学模型(IAM)分数间的发散度,动态选择何时对隐式 LM(ILM)进行折扣。与具竞争力的 RNN-T 基线相比,在会话式、码混印地语-英语 ASR 任务上,我们分别获得了整体 WER 和生僻词 PER 最高 4% 和 14% 的相对降低。
引用
@article{arxiv.2203.02317,
title = {Adaptive Discounting of Implicit Language Models in RNN-Transducers},
author = {Vinit Unni and Shreya Khare and Ashish Mittal and Preethi Jyothi and Sunita Sarawagi and Samarth Bharadwaj},
journal= {arXiv preprint arXiv:2203.02317},
year = {2022}
}
备注
Proceedings for ICASSP 2022