MultiCrossViT:基于结构 MRI 与功能网络连通性数据的精神分裂症预测多模态视觉 Transformer
计算机视觉与模式识别
2023-03-07 v2
摘要
Vision Transformer (ViT) 是一种开创性的深度学习框架,可解决现实世界中的计算机视觉问题,如图像分类与目标识别。重要的是,已被证明 ViT 优于传统深度学习模型,如卷积神经网络(CNNs)。相对近期,若干 ViT 变体已被引入医学影像领域,从而解决了诸多关键的分类与分割挑战,尤其在脑成像数据方面。本工作中,我们提出一种新颖的多模态深度学习流程 MultiCrossViT,能够同时分析结构 MRI(sMRI)与静态功能网络连通性(sFNC)数据以预测精神分裂症。在一个训练样本极少的数据集上,我们的新模型可达到 0.832 的 AUC。最后,我们基于所得 ViT 注意力图,通过从 transformer 编码器中提取特征,可视化了与精神分裂症最相关的多个脑区与协方差模式。
引用
@article{arxiv.2211.06726,
title = {MultiCrossViT: Multimodal Vision Transformer for Schizophrenia Prediction using Structural MRI and Functional Network Connectivity Data},
author = {Yuda Bi and Anees Abrol and Zening Fu and Vince Calhoun},
journal= {arXiv preprint arXiv:2211.06726},
year = {2023}
}
备注
I submitted the wrong paper