提升端到端语音识别在域外数据上的置信度估计
音频与语音处理
2022-03-03 v2 机器学习
摘要
随着端到端自动语音识别(ASR)模型达到令人满意的性能,各类下游任务依赖于这些系统的良好置信度估计器。近期研究表明,基于模型的置信度估计器相比使用输出 softmax 概率具有显著优势。若语音识别器的输入数据来自不匹配的声学与语言条件,ASR 性能及相应置信度估计器可能出现严重退化。由于置信度模型常与 ASR 在同一域内数据上训练,泛化到域外(OOD)场景具有挑战性。本文在保持 ASR 模型不变的情况下,提出两种改进域外数据上基于模型的置信度估计器的方法:使用伪转录文本与额外的 OOD 语言模型。使用在 LibriSpeech 上训练的 ASR 模型,实验表明所提方法可大幅改善 TED-LIUM 与 Switchboard 数据集上的置信度指标,同时保持域内性能。此外,改进后的置信度估计器在域外数据上校准更好,并能为数据筛选提供更可靠的标准。
引用
@article{arxiv.2110.03327,
title = {Improving Confidence Estimation on Out-of-Domain Data for End-to-End Speech Recognition},
author = {Qiujia Li and Yu Zhang and David Qiu and Yanzhang He and Liangliang Cao and Philip C. Woodland},
journal= {arXiv preprint arXiv:2110.03327},
year = {2022}
}
备注
Accepted as a conference paper at ICASSP 2022