用于脑卒中平衡多模态预后预测的视觉核心引导对比学习
计算机视觉与模式识别
2026-05-15 v1 人工智能
摘要
深度学习与多模态融合通过整合多样化数据源,在医学诊断中展现了变革性潜力。然而,由于现有多模态方法的局限性,缺血性脑卒中的准确预后仍具挑战。首先,当前方法主要局限于双模态融合,缺乏一个能有效整合医学图像、结构化临床数据和非结构化文本三要素的框架。其次,它们往往未能建立模态间的深度双向交互;为解决这些关键空白,本文提出了一种用于缺血性脑卒中预后的新颖三模态融合模型。我们的方法首先利用大语言模型(LLM)从脑部 MRI 中自动生成半结构化诊断文本,以丰富数据表示。这一过程不仅解决了专家标注稀缺的问题,还起到了正则化语义增强的作用,提升了多模态融合的鲁棒性。此外,我们设计了一个核心组件,称为视觉条件双重对齐融合模块(VDAFM),该模块策略性地将视觉特征作为条件先验,以引导与生成文本的细粒度交互。该模块通过双重语义对齐损失实现了动态且深度的融合,有效缓解了模态异质性。在真实世界临床数据集上的大量实验表明,我们的模型实现了 SOTA 性能。
引用
@article{arxiv.2605.14710,
title = {Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke},
author = {Liren Chen and Lidong Sun and Mingyan Huang and Junzhe Tang and Yinghui Zhu and Guanjie Wang and Yiqing Xia and Ting Xiao},
journal= {arXiv preprint arXiv:2605.14710},
year = {2026}
}
备注
Corresponding author: Ting Xiao