中文

视觉Transformer与CNN在数字病理中的比较研究

图像与视频处理 2022-06-02 v1 计算机视觉与模式识别 机器学习

摘要

近来,视觉Transformer在充足数据量预训练时表现出了超越卷积神经网络的能力。与卷积神经网络相比,视觉Transformer具有较弱的归纳偏置,因此允许更灵活的特征检测。由于其颇具前景的特征检测能力,本工作探索了视觉Transformer在四种组织类型的数字病理全切片图像中进行肿瘤检测以及组织类型识别的应用。我们将视觉Transformer DeiT-Tiny 与最先进的卷积神经网络 ResNet18 的块级分类性能进行了比较。由于标注全切片图像稀缺,我们进一步使用最先进的自监督方法比较了在大量未标注全切片图像上预训练的两种模型。结果表明,在四种组织类型中的三种肿瘤检测上视觉Transformer略优于ResNet18,而ResNet18在其余任务上略优。两种模型在切片级别的聚合预测相关,表明模型捕获了相似的成像特征。总体而言,视觉Transformer模型性能与ResNet18相当,但训练需更多工作量。为超越卷积神经网络性能,视觉Transformer可能需要更具挑战性的任务以利用其弱归纳偏置。

关键词

引用

@article{arxiv.2206.00389,
  title  = {A comparative study between vision transformers and CNNs in digital pathology},
  author = {Luca Deininger and Bernhard Stimpel and Anil Yuce and Samaneh Abbasi-Sureshjani and Simon Schönenberger and Paolo Ocampo and Konstanty Korski and Fabien Gaire},
  journal= {arXiv preprint arXiv:2206.00389},
  year   = {2022}
}

备注

8 pages, 2 figures, accepted for workshop T4Vision (CVPR 2022)