利用经验模态分解和沃尔什 - 阿达玛变换增强构音障碍语音特征表示
音频与语音处理
2024-01-02 v1 人工智能
信号处理
摘要
构音障碍语音包含声道和声带的病理特征,但迄今为止,这些特征尚未被纳入传统的声学特征集中。此外,语音的非线性和非平稳性一直被忽视。在本文中,我们提出了一种名为 WHFEMD 的构音障碍语音特征增强算法。该算法结合经验模态分解(EMD)和快速沃尔什 - 阿达玛变换(FWHT)来增强特征。利用所提出的算法,首先对构音障碍语音进行快速傅里叶变换,随后进行 EMD 以获得本征模态函数(IMF)。之后,使用 FWHT 输出新系数,并基于 IMF、功率谱密度和增强的伽马通频率倒谱系数提取统计特征。为了评估所提出的方法,我们在两个公共病理语音数据库(包括 UA Speech 和 TORGO)上进行了实验。结果表明,我们的算法在分类方面优于传统特征。我们分别实现了 13.8%(UA Speech)和 3.84%(TORGO)的提升。此外,结合不平衡分类算法来解决数据不平衡问题,使识别准确率提高了 12.18%。该算法有效地解决了构音障碍语音中数据集不平衡和非线性的挑战,同时提供了声带和声道局部病理特征的鲁棒表示。
引用
@article{arxiv.2401.00225,
title = {Enhancing dysarthria speech feature representation with empirical mode decomposition and Walsh-Hadamard transform},
author = {Ting Zhu and Shufei Duan and Camille Dingam and Huizhi Liang and Wei Zhang},
journal= {arXiv preprint arXiv:2401.00225},
year = {2024}
}