利用声学模型似然特征对构音障碍中的鼻音过重进行鲁棒估计
音频与语音处理
2020-09-14 v4 声音
信号处理
摘要
鼻音过重是许多运动性言语障碍中常见的特征性症状。对于浊音,鼻音过重会在较低频率引入额外的共振;对于清音,由于气流通过鼻腔逸出,会导致发音精确度降低。然而,这些症状的声学表现高度多变,使得无论对人类专家还是自动化系统,鼻音过重估计都极具挑战性。该领域先前的工作要么依赖基于统计信号处理的手工特征,要么依赖基于临床评分训练的机器学习模型。手工特征往往无法捕捉与鼻音过重相关的复杂声学模式,而基于机器学习的指标容易过拟合于其所训练的小规模疾病特异性语音数据集。本文我们提出一组新的声学特征,以捕捉这些互补维度。这些特征基于在两个大型健康语音语料上训练的两个声学模型。第一个声学模型旨在从浊音中测量鼻共振,而第二个声学模型旨在从清音中测量发音不精确性。为证明源自这些声学模型的特征对鼻音过重语音具有特异性,我们在不同的构音障碍语料上对其进行了评估。我们的结果表明,即使在一种疾病的鼻音过重语音上训练并在另一种疾病的鼻音过重语音上评估(例如,在帕金森病上训练,在亨廷顿病上评估),以及在神经紊乱语音上训练但在腭裂语音上评估时,这些特征仍能泛化。
引用
@article{arxiv.1911.11360,
title = {Robust Estimation of Hypernasality in Dysarthria with Acoustic Model Likelihood Features},
author = {Michael Saxon and Ayush Tripathi and Yishan Jiao and Julie Liss and Visar Berisha},
journal= {arXiv preprint arXiv:1911.11360},
year = {2020}
}
备注
12 pages, 9 figures, 2 tables