评估预训练音频嵌入对帕金森病语音数据分类的有效性
音频与语音处理
2025-09-01 v1 人工智能
摘要
言语障碍是帕金森病(PD)的普遍生物标志物,推动了利用语音数据开发临床应用诊断技术的发展。尽管深度声学特征在 PD 分类中展现出潜力,但由于说话人个体差异,其有效性通常存在差异,而这一因素在现有文献中尚未得到充分探讨。本研究调查了三种预训练音频嵌入(OpenL3、VGGish 和 Wav2Vec2.0 模型)在 PD 分类中的有效性。使用 NeuroVoz 数据集,OpenL3 在轮替运动(DDK)和听读(LR)任务中优于其他模型,捕获了 PD 检测的关键声学特征。在 DDK 任务中,仅 Wav2Vec2.0 表现出显著的性别偏见,对男性说话者取得了更有利的结果。被误分类的案例揭示了对非典型语音模式的挑战,凸显了在 PD 检测中改进特征提取和模型鲁棒性的必要性。
引用
@article{arxiv.2506.02078,
title = {Evaluating the Effectiveness of Pre-Trained Audio Embeddings for Classification of Parkinson's Disease Speech Data},
author = {Emmy Postma and Cristian Tejedor-Garcia},
journal= {arXiv preprint arXiv:2506.02078},
year = {2025}
}
备注
Accepted to Interspeech 2025. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants which is financed by the Dutch Research Council (NWO)