中文

提升视觉Transformer用于医学图像分类的新视角

计算机视觉与模式识别 2023-01-04 v1 人工智能

摘要

Transformer已在多种计算机视觉任务中取得令人瞩目的成功。然而,现有多数研究需要先在大规模标注数据集(如ImageNet)上预训练Transformer骨干网络以获得满意性能,而医学图像通常缺乏此类数据。此外,由于医学图像与自然图像之间存在差距,将ImageNet预训练权重迁移到医学图像处理任务时,其带来的提升显著退化。本文提出Bootstrap Own Latent of Transformer (BOLT),一种专为基于Transformer骨干的医学图像分类设计的自监督学习方法。我们的BOLT由在线分支与目标分支两个网络组成,用于自监督表示学习。具体而言,在线网络被训练以预测目标网络对同一patch嵌入令牌在施加不同扰动后的表示。为从有限的医学数据中最大程度挖掘Transformer的作用,我们提出一个辅助难度排序任务,强制Transformer识别哪个分支(即在线/目标)正在处理扰动更大的令牌。总体上,Transformer致力于从扰动令牌中提炼变换不变特征,以同时实现难度度量并保持自监督表示的一致性。所提BOLT在三项医学图像处理任务上进行了评估,即皮肤病变分类、膝关节疲劳骨折分级和糖尿病视网膜病变分级。实验结果表明,相较于ImageNet预训练权重和SOTA自监督学习方法,我们的BOLT在医学图像分类上具有优越性。

关键词

引用

@article{arxiv.2301.00989,
  title  = {A New Perspective to Boost Vision Transformer for Medical Image Classification},
  author = {Yuexiang Li and Yawen Huang and Nanjun He and Kai Ma and Yefeng Zheng},
  journal= {arXiv preprint arXiv:2301.00989},
  year   = {2023}
}