基于跨模态对齐的半监督医学指代图像分割
计算机视觉与模式识别
2026-05-18 v1 机器学习
摘要
医学指代图像分割 (MRIS) 需要与解剖位置文字描述对齐的像素级掩码,这在低标签场景下导致标注成本高昂。半监督学习 (SSL) 可通过利用无标签数据来缓解这一负担,但其成功取决于在扰动下保持可靠的图像-文本对齐。大多数现有的 SSL 基于指代分割方法要么使用独立的,要么使用简单粗糙的多模态扰动(例如左右翻转),而未充分解决在强数据增强下的跨模态对齐问题。此外,CutMix 在单模态 SSL 中效果显著,但由于其倾向于破坏图像-文本一致性,仍在多模态设置中受到鲜见关注。我们提出 Semi-MedRef,一个设计为显式维护医学图像与位置语言一致性的教师-学生 SSL 框架。该框架包含三个对齐保持组件:T-PatchMix,一种通过位置约束和概率驱动规则同步 patch 混合与指代表达式的跨模态 CutMix 风格增强;PosAug,一种基于位置的文本增强,用于遮盖或模糊解剖短语;以及 ITCL,一种基于位置引导的图像-文本对比学习模块,利用位置伪标签构建柔软的解剖正样本并强化医学导向的跨模态对齐。在 QaTa-COV19 和 MosMedData+ 上的实验表明,Semi-MedRef 在所有标签 regime 下均一致优于完全监督和半监督基线。
引用
@article{arxiv.2605.15720,
title = {Semi-MedRef: Semi-Supervised Medical Referring Image Segmentation with Cross-Modal Alignment},
author = {Yuchen Li and Zhen Zhao and Yi Liu and Luping Zhou},
journal= {arXiv preprint arXiv:2605.15720},
year = {2026}
}