用于端到端 ASR 中上下文偏置的类语言模型与词映射
计算与语言
2020-08-11 v3 声音
音频与语音处理
摘要
近年来,全神经、端到端(E2E)ASR 系统在语音识别界获得了迅速关注。它们在单一可训练神经网络模型中将语音输入转换为文本单元。在 ASR 中,许多语句包含丰富的命名实体。此类命名实体可能是用户或位置特定的,并且在训练期间未被见到。单一模型使得在推理期间利用动态上下文信息变得不灵活。在本文中,我们提出训练一个上下文感知的 E2E 模型,并允许束搜索在推理期间遍历到上下文 FST 中。我们还提出了一种简单方法来调整上下文 FST 与基础模型之间的代价差异。该算法能够将命名实体语句的 WER 降低 57%,且常规语句的精度下降很小。尽管 E2E 模型不需要发音词典,但利用现有发音知识来提高精度是有趣的。在本文中,我们提出了一种算法,通过发音将罕见实体词映射到常见词,并在识别期间将映射词视为原词的替代形式。该算法进一步将命名实体语句上的 WER 降低了 31%。
引用
@article{arxiv.2007.05609,
title = {Class LM and word mapping for contextual biasing in End-to-End ASR},
author = {Rongqing Huang and Ossama Abdel-hamid and Xinwei Li and Gunnar Evermann},
journal= {arXiv preprint arXiv:2007.05609},
year = {2020}
}
备注
In Proc. of INTERSPEECH 2020