基于非自回归端到端语音识别系统的准确可靠置信度估计
声音
2023-05-26 v2 计算与语言
音频与语音处理
摘要
为识别结果估计置信度分数是 ASR 领域的经典任务,对各类下游任务与训练策略至关重要。先前基于端到端(E2E)的置信度估计模型(CEM)预测与输入转写等长的分数序列,在出现删除与插入错误时导致不可靠估计。本文提出 CIF 对齐置信度估计模型(CA-CEM),基于新型非自回归 E2E ASR 模型——Paraformer 实现准确可靠的置信度估计。CA-CEM 利用连续积分触发(CIF)机制的建模特性生成令牌同步声学嵌入,解决了上述估计失效问题。我们以令牌级 AUC 与 RMSE 以及话语级提出的指标 ECE-U 衡量估计质量。CA-CEM 在两个测试集上使 ECE-U 相对降低 24% 与 19%,并取得更优 AUC 与 RMSE。此外,我们进行分析以探索 CEM 在不同 ASR 相关用途中的潜力。
引用
@article{arxiv.2305.10680,
title = {Accurate and Reliable Confidence Estimation Based on Non-Autoregressive End-to-End Speech Recognition System},
author = {Xian Shi and Haoneng Luo and Zhifu Gao and Shiliang Zhang and Zhijie Yan},
journal= {arXiv preprint arXiv:2305.10680},
year = {2023}
}
备注
5 pages, 4 figures, Interspeech2023