MINT:面向早期阿尔茨海默病筛查的多模态影像到语音知识传递
机器学习
2026-03-02 v1 人工智能
计算机视觉与模式识别
摘要
阿尔茨海默病是一种渐进性神经退行性疾病,其中轻度认知障碳(MCI)标志着从衰老到痴呆之间的关键转变。神经影像模态,如结构性 MRI,提供了这一转变的生物标志物;然而,其高昂成本和基础设施需求限制了其在人群规模部署。语音分析提供了一种非侵入性替代方案,但语音分类器是独立于神经影像开发的,导致决策边界缺乏生物学依据,限制了其对区分轻度认知正常者和轻度认知障碳者中细微差异的可靠性。我们提出MINT(多模态影像到语音知识传递),一个三阶段跨模态框架,将 MRI 中的生物标志物结构传递到训练时的语音编码器中。一个在 1,228 名受试者上训练的 MRI 教师定义了一个用于 CN 与 MCI 分类的紧凑神经影像嵌入空间。残差投影头通过结合几何损失将语音表征对齐到此冻结的影像流形上,在保持影像编码器忠实度的同时,将语音适应于所学的生物标志物空间。该冻结的 MRI 分类器在推断时从未接触语音,可直接应用于对齐后的嵌入上,无需扫描仪。在 ADNI-4 上的评估显示,对齐后的语音在质量上与语音基线相当(AUC 0.720 vs 0.711),且在推断时无需影像,表明 MRI 派生的决策边界可为语音表征提供生物学依据。多模态融合优于 MRI 本身(0.973 vs 0.958)。消融研究确定 dropout 正则化和自监督预训练为关键设计决策。据我们了解,这是首次演示 MRI 到语音知识传递用于早期阿尔茨海默病筛查,为无需在推断时进行神经影像的大规模认知分流建立了生物学依据的路径。
引用
@article{arxiv.2602.23994,
title = {MINT: Multimodal Imaging-to-Speech Knowledge Transfer for Early Alzheimer's Screening},
author = {Vrushank Ahire and Yogesh Kumar and Anouck Girard and M. A. Ganaie},
journal= {arXiv preprint arXiv:2602.23994},
year = {2026}
}