MedViT:一种面向通用医学图像分类的鲁棒视觉Transformer
计算机视觉与模式识别
2023-03-21 v1
摘要
卷积神经网络(CNN)推动了现有医疗系统在疾病自动诊断方面的进步。然而,由于不准确的诊断可能在安全领域导致灾难性后果,深度医疗诊断系统在面对对抗攻击潜在威胁时的可靠性仍令人担忧。在本研究中,我们提出了一种兼具CNN局部性与视觉Transformer全局连通性的高效鲁棒CNN-Transformer混合模型。为缓解自注意力机制的高二次复杂度,同时在不同表示子空间中联合关注信息,我们通过高效的卷积运算构建注意力机制。此外,为减轻Transformer模型对对抗攻击的脆弱性,我们尝试学习更平滑的决策边界。为此,我们通过在迷你批次内置换特征均值和方差,在高层特征空间中增强图像的形状信息。在计算复杂度更低的情况下,我们提出的混合模型在标准化MedMNIST-2D大规模数据集上,相较于当前最先进的研究,展现出更高的鲁棒性和泛化能力。
引用
@article{arxiv.2302.09462,
title = {MedViT: A Robust Vision Transformer for Generalized Medical Image Classification},
author = {Omid Nejati Manzari and Hamid Ahmadabadi and Hossein Kashiani and Shahriar B. Shokouhi and Ahmad Ayatollahi},
journal= {arXiv preprint arXiv:2302.09462},
year = {2023}
}