基于无噪声教师的注意力引导遮蔽图像建模的协蒸馏学习在医学图像上的自监督学习
计算机视觉与模式识别
2026-04-17 v1
摘要
遮蔽图像建模(Masked image modeling, MIM)是从无标注数据中提取有用特征表示的高效自监督学习(self-supervised learning, SSL)方法。 predominant使用的随机遮蔽方法由于相邻图像块的上下文相似性,导致信息泄露和SSL简化,使SSL在医学图像上效果不佳。分层移位窗口(Swin)变换器是一种针对医学图像高度有效的方法,由于缺乏全局[CLS]标记,无法使用先进的遮蔽方法。因此,我们在协蒸馏学习框架中引入注意力引导的遮蔽机制,用于Swin,以选择性遮蔽语义共现且具辨识力的图像块,从而减少信息泄露并增加SSL预训练的难度。然而,注意力引导的遮蔽不可避免地减少了注意力头的多样性,这会对下游任务性能产生负面影响。为此,我们首次将无噪声教师整合到协蒸馏框架中(称为DAGMaN),以执行注意力遮蔽,同时保持高注意力头的多样性。我们在包括全量和少量肺结节分类、免疫治疗结果预测、肿瘤分割以及无监督器官聚类的多个任务上展示了DAGMaN的能力。
引用
@article{arxiv.2604.14506,
title = {Co-distilled attention guided masked image modeling with noisy teacher for self-supervised learning on medical images},
author = {Jue Jiang and Aneesh Rangnekar and Harini Veeraraghavan},
journal= {arXiv preprint arXiv:2604.14506},
year = {2026}
}
备注
Accepted at MIDL 2025