基于上下文驱动的缺失模态学习:用于图像-表格医疗诊断的鲁棒方法
计算机视觉与模式识别
2026-05-26 v1
摘要
虽然将多模态数据整合多种影像和临床表格记录对于准确医疗诊断至关重要,但特定模态的任意缺失在临床实践中十分常见,严重降低了多模态模型的性能。现有方法要么丢弃缺失模态导致信息损失,要么难以在不捕获复杂模态依赖关系的情况下合成它们。为此,我们提出一种新型的 Context-driven Missing-Modality Learning(CMML)框架,顺序执行模态合成和语义对齐,以实现在任意缺失条件下的鲁棒诊断。具体而言,我们设计了基于级联残差变换器的自编码器(CRTA),利用充当数据集级语义先验的可学习上下文标记来捕获模态间依赖关系并合成关键缺失表示。这些表示进一步通过模态特定记忆库得到丰富。为解决原始可用表示与合成表示之间的差异,我们将所学的上下文标记转化为由 CRTA 输出的多模态表示驱动的实例自适应语义参考。这一参考指引将异构模态表示对齐到统一空间,最终应用类感知对比细化,以探索判别性诊断线索。广泛评估表明,在皮肤瘤(Derm7pt)、眼科疾病(ODIR)和脑膜瘤(MEN)数据集上,CMML 均显著优于当前最先进(SOTA)方法,分别实现了平均 AUC 提升 1.26%、0.97% 和 1.32%。
引用
@article{arxiv.2605.25968,
title = {Context-driven Missing-Modality Learning for Robust Medical Diagnosis with Image-Tabular Data},
author = {Tianling Liu and Lequan Yu and Tong Han and Liang Wan},
journal= {arXiv preprint arXiv:2605.25968},
year = {2026}
}
备注
12 pages, 8 figures