面向端到端语音识别系统定制化的上下文拼写校正
计算与语言
2022-09-08 v2 声音
音频与语音处理
摘要
上下文偏置是端到端自动语音识别(ASR)系统中一项重要且具有挑战性的任务,旨在通过使 ASR 系统偏向特定上下文短语(如人名、音乐列表、专有名词等)来获得更好的识别性能。现有方法主要包括上下文语言模型偏置和在端到端 ASR 模型中添加偏置编码器。在这项工作中,我们引入了一种新颖的上下文偏置方法,即在端到端 ASR 系统之上添加一个上下文拼写校正模型。我们将上下文信息整合到一个带有共享上下文编码器的序列到序列拼写校正模型中。我们提出的模型包含两种不同的机制:自回归(AR)和非自回归(NAR)。我们提出了过滤算法以处理大规模上下文列表,以及性能平衡机制以控制模型的偏置程度。我们证明所提出的模型是一种通用的偏置解决方案,对领域不敏感,可应用于不同场景。实验表明,所提出的方法在 ASR 系统基础上实现了高达 51% 的相对词错误率(WER)降低,并优于传统的偏置方法。与 AR 方案相比,所提出的 NAR 模型将模型大小减少了 43.2%,并将推理速度提升了 2.1 倍。
引用
@article{arxiv.2203.00888,
title = {Towards Contextual Spelling Correction for Customization of End-to-end Speech Recognition Systems},
author = {Xiaoqiang Wang and Yanqing Liu and Jinyu Li and Veljko Miljanic and Sheng Zhao and Hosam Khalil},
journal= {arXiv preprint arXiv:2203.00888},
year = {2022}
}
备注
Accepted in IEEE Transactions on Audio, Speech and Language Processing (TASLP)