中文

基于 HCT 与临床数据的脑水肿分类多模态深度学习框架

计算机视觉与模式识别 2026-03-31 v1 人工智能

摘要

我们提出 AttentionMixer,一个用于脑水肿多模态检测的统一深度学习框架,将结构性头部 CT(HCT)与常规临床元数据相结合。虽然 HCT 提供了丰富的空间信息,但年龄、实验室值和扫描时机等临床变量捕捉了互补上下文,可能被忽略或简单拼接。AttentionMixer 旨在以原则性和高效的方式融合这些异构来源。HCT 体积首先使用自监督 Vision Transformer Autoencoder(ViT-AE++)进行编码,无需大型标注数据集。临床元数据被映射到同一特征空间,并用作交叉注意力模块中的键和值,其中 HCT 衍生的特征向量作为查询。这种交叉注意力融合使网络能够根据患者特定上下文动态调节成像特征,并提供了多模态融合的可解释机制。轻量级 MLP-Mixer 随后细化融合表示以进行最终分类,实现全局依赖建模并大幅减少参数开销。缺失或不完整的元数据通过可学习嵌入处理,提高了面对真实世界临床数据质量的鲁棒性。我们在带有专家水肿标注的精选脑部 HCT 队列上使用五折交叉验证评估 AttentionMixer。与强 HCT-only、元数据-only 和先前多模态基线相比,AttentionMixer 取得了更优性能(准确率 87.32%,精确率 92.10%,F1 分数 85.37%,AUC 94.14%)。消融研究证实了交叉注意力和 MLP-Mixer 细化的益处,基于排列的元数据重要性分析突出了驱动预测的临床有意义变量。这些结果表明,结构化、可解释的多模态融合可以显著改善临床实践中的水肿检测。

关键词

引用

@article{arxiv.2603.26726,
  title  = {A Multimodal Deep Learning Framework for Edema Classification Using HCT and Clinical Data},
  author = {Aram Ansary Ogholbake and Hannah Choi and Spencer Brandenburg and Alyssa Antuna and Zahraa Al-Sharshahi and Makayla Cox and Haseeb Ahmed and Jacqueline Frank and Nathan Millson and Luke Bauerle and Jessica Lee and David Dornbos and Qiang Cheng},
  journal= {arXiv preprint arXiv:2603.26726},
  year   = {2026}
}