视觉 Transformer 表示在医学影像中是否具有语义意义?——一项案例研究
计算机视觉与模式识别
2025-07-11 v2 人工智能
摘要
视觉 Transformer (ViT) 因其在疾病分类、分割和检测等医学影像任务上优于传统深度学习模型的精度而迅速流行。然而,由于其规模大且通过自注意力机制进行复杂交互,ViT 代表不够被充分理解。特别是,难以确定这些模型产生的表示是否具有语义意义。本文使用投射梯度算法,我们展示了它们的表示并不具有语义意义且本质上对小变化极其脆弱。具有不可察觉差异的图像会产生截然不同的表示;相反,应该属于不同语义类别的图像可能具有近乎相同的表示。这种脆弱性可能导致不可靠的分类结果;例如,微小的不可察觉的变化会使分类准确率下降超过 60%。据我们了解,这是首次系统性地证明 ViT 在医学图像分类中缺乏语义意义的根本性问题,揭示了其在安全关键系统中部署的关键挑战。
关键词
引用
@article{arxiv.2507.01788,
title = {Are Vision Transformer Representations Semantically Meaningful? A Case Study in Medical Imaging},
author = {Montasir Shams and Chashi Mahiul Islam and Shaeke Salman and Phat Tran and Xiuwen Liu},
journal= {arXiv preprint arXiv:2507.01788},
year = {2025}
}
备注
9 pages