中文

基于 BLSTM 的端到端语音识别置信度估计

音频与语音处理 2023-12-25 v1 计算与语言

摘要

置信度估计旨在评估自动语音识别 (ASR) 假设中每个识别标记(如词、子词和字符)的可靠性并检测错误识别的标记,是开发 ASR 应用的一项重要功能。本研究针对端到端 (E2E) ASR 假设进行置信度估计。近期的 E2E ASR 系统在各种 ASR 任务中表现出高性能(例如标记错误率约为 5%)。在此类情况下,由于需要从mostly correct 的标记序列中检测罕见的错误标记,置信度估计变得困难。为解决这一数据集不平衡问题,我们采用基于双向长短期记忆 (BLSTM) 的模型作为强大的二分类(正确/错误)序列标注器,并使用类别平衡目标进行训练。实验证实,通过利用多种类型的 ASR 解码分数作为其辅助特征,该模型在高度不平衡的设置下始终表现出高置信度估计性能。我们还证实,基于 BLSTM 的模型优于基于 Transformer 的置信度估计模型,后者极大地低估了错误标记。

关键词

引用

@article{arxiv.2312.14609,
  title  = {BLSTM-Based Confidence Estimation for End-to-End Speech Recognition},
  author = {Atsunori Ogawa and Naohiro Tawara and Takatomo Kano and Marc Delcroix},
  journal= {arXiv preprint arXiv:2312.14609},
  year   = {2023}
}

备注

Accepted to ICASSP 2021