中文

一种用于端到端自动语音识别中语言模型融合的密度比方法

音频与语音处理 2020-03-02 v3 计算与语言 声音

摘要

本文描述了一种将外部语言模型(LMs)集成到端到端自动语音识别(ASR)模型中的密度比方法。所提方法应用于在某个给定域上训练的循环神经网络转导器(RNN-T)ASR 模型、一个匹配的域内 RNN-LM,以及一个目标域 RNN-LM,利用贝叶斯规则定义目标域的 RNN-T 后验概率,其方式直接类比于基于深度神经网络(DNNs)或 LSTM 的隐马尔可夫模型(HMM)框架下的经典混合 ASR 模型(Bourlard & Morgan, 1994)。该方法在跨域与有限数据场景下进行评估,其中大量目标域文本数据用于 LM 训练,但仅使用有限(或没有){音频, 转写}训练数据对来训练 RNN-T。具体而言,一个在 YouTube 的配对音频与转写数据上训练的 RNN-T 模型被评估其向语音搜索数据泛化的能力。研究发现,密度比方法在 LM 与端到端 ASR 集成的主流方法浅融合(Shallow Fusion)上持续取得更优表现。

关键词

引用

@article{arxiv.2002.11268,
  title  = {A Density Ratio Approach to Language Model Fusion in End-To-End Automatic Speech Recognition},
  author = {Erik McDermott and Hasim Sak and Ehsan Variani},
  journal= {arXiv preprint arXiv:2002.11268},
  year   = {2020}
}

备注

8 pages, 4 figures, presented at 2019 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU 2019)