中文

掩码关键内容:面向自监督医学图像分析的可控文本引导掩码方法

计算机视觉与模式识别 2025-10-07 v2

摘要

在医学影像等专业领域,标注数据的稀缺给训练鲁棒的视觉模型带来了巨大挑战。虽然自监督掩码图像建模(MIM)提供了一种有前景的解决方案,但现有方法主要依赖随机的高比例掩码,导致效率低下且语义对齐性差。此外,区域感知的变体通常依赖于重建启发式方法或监督信号,限制了其在不同任务和模态间的适应性。我们提出了 Mask What Matters,一个用于自监督医学图像分析的可控文本引导掩码框架。通过利用视觉-语言模型进行基于提示的区域定位,我们的方法灵活地应用差异化掩码,以强调诊断相关区域,同时减少背景区域的冗余。这种可控设计能够实现更好的语义对齐、改进的表示学习和更强的跨任务泛化能力。在包括脑部 MRI、胸部 CT 和肺部 X 光在内的多种医学影像模态上的综合评估表明,Mask What Matters 持续优于现有的 MIM 方法(例如 SparK),在分类准确率上最高提升 +3.1 个百分点,在检测的框平均精度(BoxAP)上提升 +1.3,在掩码平均精度(MaskAP)上提升 +1.1。值得注意的是,它在显著降低总体掩码比例(例如 40% 对比 70%)的情况下实现了这些改进。这项工作表明,可控的文本驱动掩码可以实现语义对齐的自监督学习,从而推动用于医学图像分析的稳健视觉模型的发展。

引用

@article{arxiv.2509.23054,
  title  = {Mask What Matters: Controllable Text-Guided Masking for Self-Supervised Medical Image Analysis},
  author = {Ruilang Wang and Shuotong Xu and Bowen Liu and Runlin Huang and Donglong Chen and Weifeng Su},
  journal= {arXiv preprint arXiv:2509.23054},
  year   = {2025}
}