中文

LLM监督的结构化医学ViT预训练:VIVID-Med

计算机视觉与模式识别 2026-03-12 v2 人工智能

摘要

视觉语言预训练推动了医学图像分析的显著进展。然而,当前方法通常使用 one-hot 标签或自由形式文本对视觉编码器进行监督,这 Neither 有效地捕获临床发现之间的复杂语义关系。在本研究中,我们引入VIVID-Med,一种新型框架,该框架利用冻结的大型语言模型(LLM)作为结构化语义教师来预训练医学视觉变换器(ViT)。VIVID-Med通过统一医学模式(UMS)将临床发现翻译为可验证的JSON field-state对,利用可答案意识的掩码聚焦优化。随后采用结构化预测分解(SPD)将cross-attention划分为正交正则化的查询组,从而提取互补的视觉方面。关键在于,预训练后丢弃LLM,得到轻量级、可部署的ViT-only backbone。我们在多个设置中评估了VIVID-Med:在CheXpert线性探测上,它实现了0.8588的macro-AUC,净增+6.65分,同时使用的数据是BiomedCLIP的500倍。它还显示出对NIH ChestX-ray14(0.7225 macro-AUC)的鲁棒零样本跨域迁移能力,并在LIDC-IDRI肺结节分类(0.8413 AUC)和OrganAMNIST 11器官分类(0.9969 macro-AUC)上表现出强大的跨模态泛化。VIVID-Med提供了一种高效、可扩展的替代方案,用于在临床环境中部署资源密集型视觉语言模型。

关键词

引用

@article{arxiv.2603.09109,
  title  = {VIVID-Med: LLM-Supervised Structured Pretraining for Deployable Medical ViTs},
  author = {Xiyao Wang and Xiaoyu Tan and Yang Dai and Yuxuan Fu and Shuo Li and Xihe Qiu},
  journal= {arXiv preprint arXiv:2603.09109},
  year   = {2026}
}

备注

10 pages, 4 figures