预训练 ViT 为医学图像提供通用表征
计算机视觉与模式识别
2024-11-18 v3
摘要
卷积神经网络(CNNs)作为自动化医学图像诊断的事实标准方法已主导十年,推动了分类、检测和分割任务的最先进水平。近年来,视觉 Transformer(ViTs)作为 CNNs 的竞争性替代方案出现,在自然图像领域取得了令人印象深刻的性能水平,同时具备若干可能有益于医学成像任务的有趣特性。本工作中,我们探索了基于 Transformer 的模型用于医学图像分类的优缺点。我们在多个标准 2D 医学图像基准数据集和任务上进行了一系列实验。我们的发现表明,虽然 CNNs 从零训练表现更好,但经 ImageNet 预训练的现成视觉 Transformer 在监督和自监督设置下均可与 CNNs 媲美,使其成为 CNNs 的可行替代方案。
引用
@article{arxiv.2303.07034,
title = {Pretrained ViTs Yield Versatile Representations For Medical Images},
author = {Christos Matsoukas and Johan Fredin Haslum and Moein Sorkhei and Magnus Söderberg and Kevin Smith},
journal= {arXiv preprint arXiv:2303.07034},
year = {2024}
}
备注
Extended version of arXiv:2108.09038 originally published at the ICCV 2021 Workshop on Computer Vision for Automated Medical Diagnosis