CogniAlign:基于门控交叉注意力与词级多模态语音对齐的阿尔茨海默病检测
机器学习
2025-10-27 v2 人工智能
摘要
阿尔茨海默病等认知障碍的早期检测对于实现及时的临床干预和改善患者预后至关重要。在本工作中,我们提出了 CogniAlign,一种用于阿尔茨海默病检测的多模态架构,它整合了音频与文本两种非侵入性信息源,为认知健康提供了互补的洞察。与以往在粗粒度层面融合模态的方法不同,CogniAlign 采用了一种词级时间对齐策略,基于转录时间戳将音频嵌入与对应的文本 token 进行同步。这种对齐支持了 token 级融合技术的开发,从而实现更精确的跨模态交互。为了充分利用这种对齐,我们提出了一种门控交叉注意力融合机制,其中音频特征在文本模态优越的单模态性能引导下关注文本表示。此外,我们通过在文本中插入停顿 token 并为静音区间生成音频嵌入,融入了韵律线索(特别是词间停顿),进一步丰富了两个信息流。我们在 ADReSSo 数据集上评估了 CogniAlign,它在留一受试者交叉验证设置下达到了 87.35% 的准确率,在 5 折交叉验证下达到了 90.36% 的准确率,超越了现有的 SOTA 方法。详细的消融实验证实了我们提出的对齐策略、基于注意力的融合以及韵律建模的优势。最后,我们进行了语料库分析以评估所提出的韵律特征的影响,并应用 Integrated Gradients 来识别模型在预测认知健康结果时使用的最具影响力的输入片段。
引用
@article{arxiv.2506.01890,
title = {CogniAlign: Word-Level Multimodal Speech Alignment with Gated Cross-Attention for Alzheimer's Detection},
author = {David Ortiz-Perez and Manuel Benavent-Lledo and Javier Rodriguez-Juan and Jose Garcia-Rodriguez and David Tomás},
journal= {arXiv preprint arXiv:2506.01890},
year = {2025}
}