基于结构化报告的分布式掩码医学视觉-语言模型
计算机视觉与模式识别
2025-07-30 v1
摘要
医学图像-语言预训练旨在将医学图像与临床相关文本对齐,以提高模型在各种下游任务上的性能。然而,现有模型常常难以处理医学数据中固有的变异性和模糊性,限制了其捕捉细微临床信息和不确定性的能力。本文引入一种不确定性感知的医学图像-文本预训练模型,以增强其在医学图像分析中的泛化能力。基于前期方法并聚焦胸部X光图像,我们的方法利用由大型语言模型 (LLM) 生成的结构化文本报告来增强图像数据,提供临床相关的上下文。这些报告以疾病定义开头,随后通过`表现' (appearance) 部分突出显示关键感兴趣区域,最后通过`观察' (observations) 和`诊断' (verdicts) 将模型预测置于临床语义中。通过建模图像和文本之间的及内部模态不确定性,该框架捕捉医学图像和文本固有的模糊性,从而获得更好的表示和下游任务性能。我们的模型在医学图像-文本预训练方面取得了显著进展,在多个下游任务上实现了最先进的性能。
关键词
引用
@article{arxiv.2507.21794,
title = {Distribution-Based Masked Medical Vision-Language Model Using Structured Reports},
author = {Shreyank N Gowda and Ruichi Zhang and Xiao Gu and Ying Weng and Lu Yang},
journal= {arXiv preprint arXiv:2507.21794},
year = {2025}
}
备注
Accepted in MICCAI-W 2025