用于鲁棒医学图像分类的自集成视觉Transformer (SEViT)
计算机视觉与模式识别
2022-08-08 v1
摘要
视觉Transformer (ViT) 正竞相替代卷积神经网络 (CNN),用于医学影像中的分类与分割等各类计算机视觉任务。尽管 CNN 易受对抗攻击是一个众所周知的问题,近期工作表明 ViT 同样易受此类攻击,并在攻击下出现显著性能下降。ViT 对精心设计的对抗样本之脆弱性,引发了人们对其在临床环境中安全性的严重担忧。本文提出一种新颖的自集成方法,以增强 ViT 在对抗攻击存在时的鲁棒性。所提出的自集成视觉Transformer (SEViT) 利用了如下事实:ViT 初始块学到的特征表示相对不受对抗扰动影响。基于这些中间特征表示学习多个分类器,并将其预测与最终 ViT 分类器的预测相融合,可提供对抗攻击的鲁棒性。度量各预测间的一致性还有助于检测对抗样本。在两种模态(胸部 X 光与眼底照相)上的实验证明了 SEViT 架构在灰盒(攻击者对目标模型有完全知识,但不知防御机制)设定下抵御多种对抗攻击的有效性。代码:https://github.com/faresmalik/SEViT
引用
@article{arxiv.2208.02851,
title = {Self-Ensembling Vision Transformer (SEViT) for Robust Medical Image Classification},
author = {Faris Almalik and Mohammad Yaqub and Karthik Nandakumar},
journal= {arXiv preprint arXiv:2208.02851},
year = {2022}
}