基于语音可懂度专家混合的失语症语音识别
音频与语音处理
2023-03-21 v1 声音
摘要
鲁棒的语音识别是自动失语症语音分析中语义特征提取的关键前提。然而,标准的一刀切自动语音识别模型在应用于失语症语音时表现不佳。原因之一是由于不同程度严重程度导致的语音可懂度范围广泛(即严重程度越高,语音越不可懂)。为此,我们提出了一种基于专家混合(MoE)的新型声学模型,它通过明确定义基于严重程度的专家来处理失语症语音中存在的不同可懂度阶段。在测试时,每个专家的贡献通过用语音可懂度检测器(SID)估计语音可懂度来决定。我们表明,与未将严重程度信息纳入建模过程的基线方法相比,我们提出的方法显著降低了失语症语音在所有严重程度阶段的音素错误率。
引用
@article{arxiv.2008.10788,
title = {Aphasic Speech Recognition using a Mixture of Speech Intelligibility Experts},
author = {Matthew Perez and Zakaria Aldeneh and Emily Mower Provost},
journal= {arXiv preprint arXiv:2008.10788},
year = {2023}
}
备注
4 pages