MedCutMix:面向放射学视觉语言预训练的数据主导方法及疾病感知
计算机视觉与模式识别
2025-09-23 v1
摘要
视觉语言预训练(VLP)正日益受到关注,因为其能够最小化手动标注需求,同时增强下游任务中的语义理解能力。然而,其对图像-文本数据集的依赖带来了隐私 concerns 和获取配对标注高成本的挑战。数据增强是一种可行的策略,旨在解决此问题,但现有方法往往难以捕捉医学数据中细微且复杂的变化 due to limited diversity。为此,我们提出MedCutMix,一种新型多模态疾病导向数据增强方法。MedCutMix 在医学报告中执行诊断句子CutMix,并在诊断句子和医学图像之间建立cross-attention,以引导注意力manifold在影像模态中的混合。我们的做法在四个下游放射学诊断数据集上超越了前任方法,凸显其在增强放射学VLP性能和泛化能力方面的有效性。
引用
@article{arxiv.2509.16673,
title = {MedCutMix: A Data-Centric Approach to Improve Radiology Vision-Language Pre-training with Disease Awareness},
author = {Sinuo Wang and Yutong Xie and Yuyuan Liu and Qi Wu},
journal= {arXiv preprint arXiv:2509.16673},
year = {2025}
}