基于 DNN 的语义模型用于 N-best 语音识别列表重打分
计算与语言
2020-11-03 v1
摘要
由于噪声等原因导致训练与测试条件失配时,自动语音识别(ASR)系统的词错率(WER)会上升。此时声学信息可靠性降低。本工作旨在通过建模长期语义关系以补偿失真的声学特征来改进 ASR。我们提出通过对 ASR N-best 假设列表重打分来实现这一点。为此,我们训练了一个深度神经网络(DNN)。我们的 DNN 重打分模型旨在选择具有更好语义一致性从而更低 WER 的假设。我们探究了两类表示作为 DNN 模型输入特征的一部分:静态词嵌入(来自 word2vec)与动态上下文嵌入(来自 BERT)。同时也纳入了声学与语言特征。我们在公开数据集 TED-LIUM 混合真实噪声上实验。所提出的重打分方法在两种噪声条件及 n-gram 与 RNNLM 下,相较无重打分模型的 ASR 系统显著改善了 WER。
引用
@article{arxiv.2011.00975,
title = {DNN-Based Semantic Model for Rescoring N-best Speech Recognition List},
author = {Dominique Fohr and Irina Illina},
journal= {arXiv preprint arXiv:2011.00975},
year = {2020}
}