中文

基于语音的认知衰退预测:一种多模态AI方法用于痴呆筛查

音频与语音处理 2025-02-14 v1

摘要

近期在通过患者语音录音完全检测早期痴呆方面取得了显著进展。本文应用多模态语音分析方法参加PROCESS挑战赛,该挑战赛要求参赛者使用临床访谈的音频录音来预测患者为健康对照组、轻度认知障碍(MCI)或痴呆,并回归患者的精神状态检查(MMSE)分数。本工作实现的方法结合了声学特征(如eGeMAPS和Prosody)与Whisper和RoBERTa模型生成的嵌入,实现了在回归(RMSE: 2.7666)和分类(Macro-F1得分: 0.5774)任务中的优异成绩。此外,本文采用一种新颖的两级分类设置,以更好地区分MCI和痴呆。我们的 approach 在测试集上取得了强烈的成绩,在37支队伍中排第七名(回归)和第十一名(分类),超越了基线结果。

关键词

引用

@article{arxiv.2502.08862,
  title  = {Predicting Cognitive Decline: A Multimodal AI Approach to Dementia Screening from Speech},
  author = {Lei Chi and Arav Sharma and Ari Gebhardt and Joseph T. Colonel},
  journal= {arXiv preprint arXiv:2502.08862},
  year   = {2025}
}

备注

Submitted to IEEE ICAD 2025