利用检测并跳过方法在数据有限情况下增强口吃语音的自动语音识别
音频与语音处理
2022-02-14 v1 计算与语言
机器学习
声音
摘要
据估计,全球约有7000万人受到一种称为口吃的言语障碍的影响。随着自动语音识别(ASR)的最新进展,语音助手在我们日常生活中的用途越来越广泛。教育、零售、电信和医疗领域的许多技术现在都可以通过语音进行操作。遗憾的是,口吃者(PWS)无法享受这些便利。我们提出了一种简单而有效的方法“检测并跳过”(Detect and Pass),以在数据有限的场景下使现代ASR系统能够服务于口吃者。该算法使用在有限数据上训练的上下文感知分类器来检测包含口吃的声学帧。为了提高对口吃语音的鲁棒性,这一额外信息被传递给ASR模型,在推理时加以利用。我们的实验显示,在各种最先进的ASR系统中,词错误率(WER)降低了12.18%至71.24%。通过调整用于确定低帧率(LFR)声学特征的每个堆叠帧的口吃相关后验概率阈值,我们确定了最优设置,在不同ASR系统中将WER降低了23.93%至71.67%。
引用
@article{arxiv.2202.05396,
title = {Enhancing ASR for Stuttered Speech with Limited Data Using Detect and Pass},
author = {Olabanji Shonibare and Xiaosu Tong and Venkatesh Ravichandran},
journal= {arXiv preprint arXiv:2202.05396},
year = {2022}
}