中文

基于语音的深度学习方法用于帕金森病分类的创新研究:系统综述

声音 2024-09-25 v4 人工智能 计算与语言 机器学习 音频与语音处理

摘要

帕金森病(PD)是全球第二大常见的神经退行性疾病,常以早期语音障碍的形式出现。近期人工智能(AI),特别是深度学习(DL)的进展显著提升了通过分析语音数据进行PD诊断的能力。然而,研究进展受限于公开可访问的基于语音的PD数据集的稀缺,主要由于隐私原因。本系统综述旨在基于2020年1月至2024年3月发表的33篇科学文献,探讨当前基于语音的DL方法在PD分类中的现状。我们讨论了这些方法的可用资源、能力及其潜在局限性,以及与偏见、可解释性和隐私相关的问题。此外,本综述提供了公开可访问的基于语音的PD数据集和开源资源的概览。我们识别出的DL方法分为三类:端到端学习(E2E)、迁移学习(TL)和深度声学特征提取(DAFE)。在E2E方法中,卷积神经网络(CNN)最为常见,尽管Transformer正日益流行。E2E方法面临数据和计算资源有限的挑战,尤其是针对Transformer。TL通过提供更稳健的PD诊断和更好的跨语言泛化能力来解决这些问题。DAFE旨在通过检查深层特征对其他DL方法以及更传统的机器学习(ML)方法的具体影响来提高结果的可解释性和可解释性。然而,DAFE往往表现不如E2E和TL方法。

关键词

引用

@article{arxiv.2407.17844,
  title  = {Innovative Speech-Based Deep Learning Approaches for Parkinson's Disease Classification: A Systematic Review},
  author = {Lisanne van Gelderen and Cristian Tejedor-García},
  journal= {arXiv preprint arXiv:2407.17844},
  year   = {2024}
}

备注

van Gelderen, L., & Tejedor-Garc\'ia, C. (2024). Innovative Speech-Based Deep Learning Approaches for Parkinson's Disease Classification: A Systematic Review. Applied Sciences, 14(17). doi:10.3390/app14177873 This research was funded by the NWO research programme NGF AiNed Fellowship Grants under the project Responsible AI for Voice Diagnostics (RAIVD) - grant number NGF.1607.22.013