中文

端到端自动语音识别中词级置信度估计的评估

音频与语音处理 2021-01-15 v1 计算与语言 声音

摘要

量化预测的置信度(或反之不确定性)是自动系统极为可取的特质,因为它提升了在下游任务中的鲁棒性与实用性。本文研究端到端自动语音识别(ASR)的置信度估计。先前工作已探讨基于格的ASR的置信度量,而当前机器学习研究多聚焦于非结构化深度学习的置信度量。然而,由于ASR系统日益构建于深度端到端方法之上,在此背景下尝试开发置信度度量的工作甚少。我们通过提供在四个知名语音数据集上流行置信度方法的广泛基准测试填补了这一空白。我们在适配现有方法时克服了两大挑战:处理结构化数据(序列)以及获取比预测更粗粒度(词而非token)的置信度。我们的结果表明,一个强基线可通过用学习到的温度缩放logits,继而将置信度估计为预测分布的负熵,最后通过求和池化在词级聚合而获得。

关键词

引用

@article{arxiv.2101.05525,
  title  = {An evaluation of word-level confidence estimation for end-to-end automatic speech recognition},
  author = {Dan Oneata and Alexandru Caranica and Adriana Stan and Horia Cucu},
  journal= {arXiv preprint arXiv:2101.05525},
  year   = {2021}
}

备注

Accepted at SLT 2021