中文

是时候用 Transformer 替代 CNN 处理医学图像了吗?

计算机视觉与模式识别 2021-08-23 v1 机器学习

摘要

卷积神经网络(CNNs)作为自动化医学图像诊断的事实标准方法已主导十年。近来,视觉 Transformer(ViTs)作为 CNN 的竞争性替代出现,在取得相似性能水平的同时具备若干可能对医学成像任务有益的有趣特性。本文中,我们探讨是否该转向基于 Transformer 的模型,还是应继续使用 CNN——我们能否轻易切换至 Transformer?若可以,切换至 ViT 进行医学图像诊断的优势与缺陷为何?我们在三个主流医学图像数据集上通过一系列实验考量这些问题。我们的发现表明:尽管 CNN 在从头训练时表现更优,但使用默认超参数的现成视觉 Transformer 在 ImageNet 上预训练后与 CNN 相当,并在自监督预训练时优于其 CNN 对应模型。

关键词

引用

@article{arxiv.2108.09038,
  title  = {Is it Time to Replace CNNs with Transformers for Medical Images?},
  author = {Christos Matsoukas and Johan Fredin Haslum and Magnus Söderberg and Kevin Smith},
  journal= {arXiv preprint arXiv:2108.09038},
  year   = {2021}
}

备注

Originally published at the ICCV 2021 Workshop on Computer Vision for Automated Medical Diagnosis (CVAMD)