用于医学图像分析的噪声正则化教师引导自蒸馏掩码注意力掩码图像建模(SMART)
计算机视觉与模式识别
2024-07-04 v2
摘要
利用注意力引导的掩码图像建模(MIM)预训练视觉Transformer(ViT)已被证明可提升自然图像分析的下游精度。常用于医学图像分析的分层移位窗口(Swin)Transformer 无法使用注意力引导掩码,因其缺乏用于计算选择性掩码注意力图所需的显式 [CLS] 令牌。因此我们以增强的语义类注意力改进了 Swin。我们开发了一种共蒸馏 Swin Transformer,其结合噪声动量更新教师来引导 MIM 的选择性掩码。我们提出的方法称为语义注意力引导共蒸馏带噪声教师正则化 Swin Transformer(SMARTFormer),被应用于分析带有肺结节与恶性肺癌(LC)的 3D 计算机断层扫描数据集。我们还分析了语义注意力与噪声教师对预训练及下游精度的影响。SMARTFormer 以 0.895 的高精度(基于 1000 个结节)分类病变(恶性与良性),以 0.74 的精度预测 LC 治疗反应,并在有限数据情形下也取得了高精度。采用语义注意力与噪声教师预训练提升了在无监督聚类任务中区分器官等语义有意义结构以及定位肿瘤等异常结构的能力。代码与模型将在论文接收后通过 GitHub 公开。
引用
@article{arxiv.2310.01209,
title = {Self-distilled Masked Attention guided masked image modeling with noise Regularized Teacher (SMART) for medical image analysis},
author = {Jue Jiang and Aneesh Rangnekar and Chloe Min Seo Choi and Harini Veeraraghavan},
journal= {arXiv preprint arXiv:2310.01209},
year = {2024}
}
备注
Paper is under review at TMI