面向语音辅助阿尔茨海默病检测的双阶段时序-上下文网络
声音
2026-02-09 v1
摘要
阿尔茨海默病 (AD) 是一种渐进性神经退行性疾病,导致记忆和沟通能力不可逆的认知衰退。通过语音分析早期检测 AD 至关重要,以延缓疾病进程。然而,现有方法主要使用预训练的声学模型进行特征提取,但在建模长时长语音的局部和全局模式方面能力有限。本文介绍一种用于语音辅助 AD 检测的双阶段时序-上下文网络 (DSTC-Net),将局部声学特征与长时段记录中的全局对话上下文相结合。我们首先将每个长时段记录划分为固定长度的片段,以减少计算开销并保留局部时序细节。随后,将这些片段输入到 Intra-Segment Temporal Attention (ISTA) 模块,其中采用带帧级注意力的双向长短期记忆 (BiLSTM) 网络提取增强的局部特征。随后,Cross-Segment Context Attention (CSCA) 模块应用基于卷积的上下文建模和自适应注意力,以统一所有片段中的全局模式。广泛的实验表明,DSTC-Net 在 ADReSSo 数据集上优于最新模型,准确率达 83.10%,F1 分数达 83.15%。
引用
@article{arxiv.2502.13064,
title = {A Dual-Stage Time-Context Network for Speech-Based Alzheimer's Disease Detection},
author = {Yifan Gao and Long Guo and Hong Liu},
journal= {arXiv preprint arXiv:2502.13064},
year = {2026}
}