中文

用于脑卒中平衡多模态预后预测的视觉核心引导对比学习

计算机视觉与模式识别 2026-05-15 v1 人工智能

摘要

深度学习与多模态融合通过整合多样化数据源,在医学诊断中展现了变革性潜力。然而,由于现有多模态方法的局限性,缺血性脑卒中的准确预后仍具挑战。首先,当前方法主要局限于双模态融合,缺乏一个能有效整合医学图像、结构化临床数据和非结构化文本三要素的框架。其次,它们往往未能建立模态间的深度双向交互;为解决这些关键空白,本文提出了一种用于缺血性脑卒中预后的新颖三模态融合模型。我们的方法首先利用大语言模型(LLM)从脑部 MRI 中自动生成半结构化诊断文本,以丰富数据表示。这一过程不仅解决了专家标注稀缺的问题,还起到了正则化语义增强的作用,提升了多模态融合的鲁棒性。此外,我们设计了一个核心组件,称为视觉条件双重对齐融合模块(VDAFM),该模块策略性地将视觉特征作为条件先验,以引导与生成文本的细粒度交互。该模块通过双重语义对齐损失实现了动态且深度的融合,有效缓解了模态异质性。在真实世界临床数据集上的大量实验表明,我们的模型实现了 SOTA 性能。

关键词

引用

@article{arxiv.2605.14710,
  title  = {Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke},
  author = {Liren Chen and Lidong Sun and Mingyan Huang and Junzhe Tang and Yinghui Zhu and Guanjie Wang and Yiqing Xia and Ting Xiao},
  journal= {arXiv preprint arXiv:2605.14710},
  year   = {2026}
}

备注

Corresponding author: Ting Xiao