中文

AdvMIM:针对半监督医学图像分割的对抗式掩码图像建模

计算机视觉与模式识别 2025-06-26 v1

摘要

Vision Transformer 最近因其在捕获长程依赖方面的卓越能力而在医学图像分割任务中获得了巨大的流行。然而,Transformer 需要大量标记数据才能发挥作用,这阻碍了其在标注数据有限的半监督学习场景的应用。在半监督学习方法中,针对 Transformer 与卷积神经网络之间的交叉教学提出了组合 CNN-Transformer 学习方法,取得了令人期待的结果。然而,在有限标记数据下有效训练 Transformer 仍然是一个具有挑战性的任务。本文提出一种对抗式掩码图像建模方法,以充分发挥 Transformer 在半监督医学图像分割中的潜力。半监督学习中 Transformer 的关键挑战在于缺乏足够的监督信号。为此,我们提出构建一个来自原始域的辅助掩码域,并训练 Transformer 使用掩码输入预测整个分割掩码,以增加监督信号。我们利用标记数据中的原始标签和未标记数据中的伪标签来学习掩码域。为进一步从掩码域获益于原始域,我们从多域学习视角对该方法进行理论分析,并设计一种新的对抗训练损失来减少原始域与掩码域之间的域间差距,从而提升半监督学习性能。我们还将对抗式掩码图像建模扩展到 CNN 网络。在三个公开的医学图像分割数据集上进行大量实验表明,我们的方法有效,而且显著优于现有方法。我们的代码已公开于 https://github.com/zlheui/AdvMIM。

关键词

引用

@article{arxiv.2506.20563,
  title  = {AdvMIM: Adversarial Masked Image Modeling for Semi-Supervised Medical Image Segmentation},
  author = {Lei Zhu and Jun Zhou and Rick Siow Mong Goh and Yong Liu},
  journal= {arXiv preprint arXiv:2506.20563},
  year   = {2025}
}

备注

Accepted to MICCAI 2025