CMViM:用于阿尔茨海默病分类的3D多模态表示学习的对比掩码Vim自编码器
计算机视觉与模式识别
2024-03-26 v1
摘要
阿尔茨海默病(AD)是一种导致认知和功能衰退的不可治愈的神经退行性疾病。由于缺乏治愈方法,及时和精确的AD诊断至关重要,这是一个依赖于多种因素和多模态数据的复杂过程。尽管在多模态表示学习融入医学数据集方面已取得成功的努力,但对3D医学图像的关注甚少。本文提出对比掩码Vim自编码器(CMViM),这是首个为3D多模态数据量身定制的高效表示学习方法。我们提出的框架构建于掩码Vim自编码器之上,以学习统一的多模态表示和3D医学图像中包含的长程依赖关系。我们还引入了一个模态内对比学习模块,以增强多模态Vim编码器对同一模态内判别性特征建模的能力,以及一个模态间对比学习模块,以缓解模态间表示不对齐的问题。我们的框架包含两个主要步骤:1)将Vision Mamba(Vim)融入掩码自编码器,以高效重建3D掩码多模态数据。2)通过模态内和模态间两个方面的对比学习机制对齐多模态表示。我们的框架在ADNI2数据集上进行预训练和验证,并在AD分类的下游任务上进行验证。与其他最先进方法相比,所提出的CMViM在AUC性能上提升了2.7%。
引用
@article{arxiv.2403.16520,
title = {CMViM: Contrastive Masked Vim Autoencoder for 3D Multi-modal Representation Learning for AD classification},
author = {Guangqian Yang and Kangrui Du and Zhihan Yang and Ye Du and Yongping Zheng and Shujun Wang},
journal= {arXiv preprint arXiv:2403.16520},
year = {2024}
}
备注
11 pages, 1 figure