中文

基于语言与声学表征学习的多模态痴呆检测框架

声音 2026-05-26 v1 机器学习

摘要

阿尔弗雷德病(AD)是一种渐进性神经退化性疾病,是血管性痴呆的主要原因,影响记忆、推理、沟通和日常功能。早期诊断尤为重要,因为及时的干预可能有助于减缓认知衰退并改善患者护理。最近的研究表明,自发语音包含与痴呆相关的有价值的语言和声学生物标志物。然而,现有方法常依赖独立训练的模态特定模型、特征拼接策略、集成方法或注意力基于的融合机制,这些方法未显式最大化语音和转录表征之间的依赖性。本文提出一种用于自动痴呆检测的多模态深度学习框架,能够以端到端可训练的方式联合利用语音和转录信息。具体而言,将语音录音分为10秒片段,通过预训练的HuBERT模型提取情境化声学表征。为更好地捕获信息丰富的时序语音特征,采用注意力统计池化来聚合帧级声学嵌入。对于文本模态,通过预训练的BERT模型对转录进行编码,其中[CLS]标记表征用作语言嵌入。随后,通过基于注意力的Audio-Text Fusion(AT-Fusion)机制将声学和文本表征进行融合。此外,我们引入MINE目标以最大化模态之间的相互信息,提高多模态表征的对齐度。最终,融合后的多模态表征用于痴呆分类。在公开可用的ADReSS挑战数据集和PROCESS-2数据集上进行的实验表明,所提出的方法对基于语音的痴呆评估具有有效性和鲁棒性。

关键词

引用

@article{arxiv.2605.25540,
  title  = {A Multimodal Framework for Dementia Detection via Linguistic and Acoustic Representation Learning},
  author = {Loukas Ilias and Dimitris Askounis},
  journal= {arXiv preprint arXiv:2605.25540},
  year   = {2026}
}