面向阿尔茨海默病及相关痴呆检测的基石语音与语言模型基准测试
计算与语言
2025-06-16 v1 声音
音频与语音处理
摘要
背景:阿尔茨海默病及相关痴呆(ADRD)是 Progressive 神经退行性疾病,早期检测对于及时干预和护理至关重要。自发语音包含丰富的声学和语言特征,可能作为认知衰退的非侵入性生物标志物。基石模型是预训练于大规模音频或文本数据,产生高维嵌入,编码上下文和声学特征的方法。方法:我们使用了包括超过1600名伴有三种认知状态(健康对照 HC、轻度认知障碍 MCI 和阿尔茨海默病 AD)的语音记录的 PREPARE 挑战数据集。我们排除了非英语、非自发语音或质量较差的录音。最终数据集包括703人(59.13%)为 HC,81人(6.81%)为 MCI,和405人(34.06%)为 AD 案例。我们对一系列开源基石语音和语言模型进行基准测试,以将认知状态分类为三类。结果:Whisper-medium 模型在语音模型中取得最佳表现(准确率=0.731,AUC=0.802)。在语言模型中,带停顿标注的 BERT 表现最佳(准确率=0.662,AUC=0.744)。使用基于最先进的自动语音识别(ASR)模型生成的音频嵌入进行的 ADRD 检测优于其他方法。持續包含如停顿模式等非语义特征,始终能提升基于文本的分类效果。结论:本研究引入了使用基石模型和临床相关数据集的基准测试框架。声学方法——特别是基于 ASR 生成的嵌入——在可扩展、非侵入性且成本效益高的早期 ADRD 检测方面显示出强大的潜力。
引用
@article{arxiv.2506.11119,
title = {Benchmarking Foundation Speech and Language Models for Alzheimer's Disease and Related Dementia Detection from Spontaneous Speech},
author = {Jingyu Li and Lingchao Mao and Hairong Wang and Zhendong Wang and Xi Mao and Xuelei Sherry Ni},
journal= {arXiv preprint arXiv:2506.11119},
year = {2025}
}