一种用于端到端自动语音识别中语言模型融合的密度比方法
音频与语音处理
2020-03-02 v3 计算与语言
声音
摘要
本文描述了一种将外部语言模型(LMs)集成到端到端自动语音识别(ASR)模型中的密度比方法。所提方法应用于在某个给定域上训练的循环神经网络转导器(RNN-T)ASR 模型、一个匹配的域内 RNN-LM,以及一个目标域 RNN-LM,利用贝叶斯规则定义目标域的 RNN-T 后验概率,其方式直接类比于基于深度神经网络(DNNs)或 LSTM 的隐马尔可夫模型(HMM)框架下的经典混合 ASR 模型(Bourlard & Morgan, 1994)。该方法在跨域与有限数据场景下进行评估,其中大量目标域文本数据用于 LM 训练,但仅使用有限(或没有){音频, 转写}训练数据对来训练 RNN-T。具体而言,一个在 YouTube 的配对音频与转写数据上训练的 RNN-T 模型被评估其向语音搜索数据泛化的能力。研究发现,密度比方法在 LM 与端到端 ASR 集成的主流方法浅融合(Shallow Fusion)上持续取得更优表现。
引用
@article{arxiv.2002.11268,
title = {A Density Ratio Approach to Language Model Fusion in End-To-End Automatic Speech Recognition},
author = {Erik McDermott and Hasim Sak and Ehsan Variani},
journal= {arXiv preprint arXiv:2002.11268},
year = {2020}
}
备注
8 pages, 4 figures, presented at 2019 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU 2019)