通过匹配间关系建模增强医学视觉-语言对比学习
计算机视觉与模式识别
2025-02-10 v2
摘要
可以通过医学视觉-语言对比学习(mVLCL)学习医学图像表示,其中医学影像报告通过图文对齐作为弱监督。这些学习到的图像表示可以迁移并使各种下游医学视觉任务受益,例如疾病分类和分割。最近的 mVLCL 方法尝试将图像子区域和报告关键词对齐为局部匹配。然而,这些方法通过简单的池化操作聚合所有局部匹配,同时忽略了它们之间的内在关系。因此,这些方法无法在语义相关的局部匹配之间进行推理,例如对应于疾病词和位置词的局部匹配(语义关系),也无法将这些具有临床重要性的局部匹配与其他对应于意义较小词汇(例如连词)的局部匹配区分开来(重要性关系)。因此,我们提出了一种 mVLCL 方法,通过关系增强对比学习框架(RECLF)对局部匹配之间的匹配间关系进行建模。在 RECLF 中,我们引入了语义关系推理模块(SRM)和重要性关系推理模块(IRM),以实现用于图像表示学习的更细粒度的报告监督。我们在四个下游任务(包括分割、零样本分类、线性分类和跨模态检索)的六个公开基准数据集上评估了我们的方法。我们的结果表明,与最先进的 mVLCL 方法相比,我们的 RECLF 在单模态和跨模态任务中均表现出一致的改进,具有优越性。这些结果表明,我们的 RECLF 通过对匹配间关系进行建模,可以学习到具有更好泛化能力的改进医学图像表示。
关键词
引用
@article{arxiv.2401.10501,
title = {Enhancing medical vision-language contrastive learning via inter-matching relation modelling},
author = {Mingjian Li and Mingyuan Meng and Michael Fulham and David Dagan Feng and Lei Bi and Jinman Kim},
journal= {arXiv preprint arXiv:2401.10501},
year = {2025}
}
备注
Published at IEEE Transactions on Medical Imaging