中文

面向端到端儿童语音识别的语句级神经置信度度量

音频与语音处理 2021-09-17 v1 声音

摘要

置信度度量是部署在真实场景中的自动语音识别(ASR)系统尤为重要的性能指标。本研究探讨端到端自动语音识别(E2E ASR)中的语句级神经置信度度量(NCM)。E2E系统采用联合CTC-注意力Transformer架构。NCM的预测被表述为一个二分类任务,即基于ASR解码过程中获取的一组预测特征来接受/拒绝输入语句。研究重点在于评估和比较源自E2E系统不同内部和外部模块的预测特征的有效性。实验在儿童语音上进行,对此最先进的ASR系统表现不尽如人意,而鲁棒的置信度度量尤为有用。注意到,与语音声学信息相关的预测特征比与语言信息相关的特征在估计置信度度量中起着更重要的作用。N-best分数特征表现出明显优于single-best特征的性能。研究还表明,EER和AUC指标并不适合评估存在显著性能差距的不匹配ASR的NCM。

关键词

引用

@article{arxiv.2109.07750,
  title  = {Utterance-level neural confidence measure for end-to-end children speech recognition},
  author = {Wei Liu and Tan Lee},
  journal= {arXiv preprint arXiv:2109.07750},
  year   = {2021}
}

备注

accepted by ASRU 2021