中文

用于 PD 检测的半监督语音嵌入的新型融合架构

声音 2024-11-20 v2 机器学习

摘要

我们提出了一个框架,通过 Web 应用程序从多样化的录音设置和环境(包括来宾家中)收集的英文散文发音来识别帕金森病(PD)。该数据集包括 1306 名来自全球范围内的受试者,其中包括 392 名确诊 PD 患者。充分利用了数据集的多样性,涵盖各种人口学属性(如年龄、性别和种族),我们使用来自半监督模型(如 Wav2Vec 2.0、WavLM 和 ImageBind)的深度学习嵌入表示与 PD 相关的语音动力学。我们 novel 的 PD 分类融合模型,将不同的语音嵌入对齐到统一的特征空间,性能优于基于标准拼接的融合模型和其他基线(包括基于传统声学特征的模型)。在随机数据分割配置下,该模型实现了 88.94% 的受试者工作特征曲线下面积(AUROC)和 85.65% 的准确率。严格的统计分析确认,我们的模型在不同人口学亚群(包括性别、种族和年龄)中表现均等,且不受疾病持续时间的影响。此外,当本模型在两个完全不可见的测试数据集(分别来自临床环境和 PD 护理中心)上测试时,分别保持 82.12% 和 78.44% 的 AUROC 分数。这一结果确认了该模型的鲁棒性及其潜在的提升可访问性和健康公平性的实际应用。

关键词

引用

@article{arxiv.2405.17206,
  title  = {A Novel Fusion Architecture for PD Detection Using Semi-Supervised Speech Embeddings},
  author = {Tariq Adnan and Abdelrahman Abdelkader and Zipei Liu and Ekram Hossain and Sooyong Park and MD Saiful Islam and Ehsan Hoque},
  journal= {arXiv preprint arXiv:2405.17206},
  year   = {2024}
}

备注

31 pages, 6 figures, and 8 tables