基于显式上下文向量学习的注意力编码器-解码器 ASR 内部语言模型估计
音频与语音处理
2022-11-03 v3 人工智能
声音
摘要
端到端(E2E)ASR 模型从训练文本中隐式学习先验内部语言模型(ILM)。为使用贝叶斯后验理论融合外部 LM,必须准确估计并减去 ILM 产生的对数似然。本文提出两种基于 Listen-Attend-Spell (LAS) 框架估计 ILM 的新方法。第一种方法是在每个时间步用从训练文本中学习得到的向量替换 LAS 解码器的上下文向量。此外,我们提出另一种方法,使用轻量级前馈网络在动态意义上直接将查询向量映射为上下文向量。由于上下文向量通过最小化训练文本上的困惑度来学习,且其估计独立于编码器输出,因此两种方法均能准确学习 ILM。实验表明,ILM 取得了最低困惑度,证明了所提方法的有效性。此外,在多个数据集上,它们也显著优于浅融合方法以及两种先前提出的 ILM 估计(ILME)方法。
引用
@article{arxiv.2201.11627,
title = {Internal Language Model Estimation Through Explicit Context Vector Learning for Attention-based Encoder-decoder ASR},
author = {Yufei Liu and Rao Ma and Haihua Xu and Yi He and Zejun Ma and Weibin Zhang},
journal= {arXiv preprint arXiv:2201.11627},
year = {2022}
}
备注
Proceedings of INTERSPEECH