中文

建模病理语音的表示学习策略:多频谱分辨率的影响

音频与语音处理 2022-09-20 v1 声音 定量方法

摘要

本文考虑一种表示学习策略来建模来自帕金森病以及唇腭裂患者的语音信号。特别地,它比较了不同的参数化表示类型,如宽带与窄带谱图,以及基于小波的小波标度图,旨在量化各自的表示能力。量化方法包括所提模型分类不同病理及其相关疾病严重程度的能力。此外,本文提出一种称为多频谱融合的新融合策略,该策略基于自编码器的表示学习来结合宽带与窄带频谱分辨率。所提模型能够以高达95%的准确率对帕金森病患者的语音进行分类。所提模型还能以高达0.75的Spearman相关系数评估帕金森病患者的构音障碍严重程度。这些结果优于文献中使用相同语料处理同一问题所观察到的结果。

关键词

引用

@article{arxiv.2209.08379,
  title  = {Representation Learning Strategies to Model Pathological Speech: Effect of Multiple Spectral Resolutions},
  author = {Gabriel Figueiredo Miller and Juan Camilo Vásquez-Correa and Juan Rafael Orozco-Arroyave and Elmar Nöth},
  journal= {arXiv preprint arXiv:2209.08379},
  year   = {2022}
}

备注

7 pages, 3 figures