ProbMed:面向医学多模态绑定的概率框架
计算机视觉与模式识别
2025-10-01 v1
摘要
医学决策需要整合来自影像学、临床叙述等多样化医学信息。这些医学模态往往以一对多的方式获取。然而,现有的医学视觉语言预训练模型(Med-VLPMs)在模型训练和嵌入表示中未能直接考虑这种一对多映射。为此,我们提出了概率模式增强诊断(Probabilistic Modality-Enhanced Diagnosis, ProbMED),这是一种多模态Med-VLPM,采用概率对比学习来建模嵌入上的分布,而非确定性估计。ProbMED 将四种不同模态——胸片、心电图、超声心动图和临床文本—对齐到统一的概率嵌入空间。我们采用 Hellinger 距离的 InfoNCE 损失来整合跨模态分布。引入概率合成采样损失以捕获模态特定的均值和方差,以提高同一模态内的绑定。广泛的实验在13个医学数据集上表明,我们的模型在跨模态检索、零样本和少样本分类中超越当前Med-VLPM。我们还展示了多模态集成用于预后评估的鲁棒性,显示出改善了医学模态之间的内部分离和跨模态绑定。
引用
@article{arxiv.2509.25711,
title = {ProbMed: A Probabilistic Framework for Medical Multimodal Binding},
author = {Yuan Gao and Sangwook Kim and Jianzhong You and Chris McIntosh},
journal= {arXiv preprint arXiv:2509.25711},
year = {2025}
}
备注
ICCV 2025