中文

影响 2D 与 3D 医学图像分类中 Vision Transformer 精细调优的补丁大小

计算机视觉与模式识别 2026-02-24 v1

摘要

Vision Transformer (ViT) 及其变体在众多计算机视觉任务中成为最先进技术,广泛用作大规模视觉和视觉-语言基础模型的 backbone。虽然已有大量研究聚焦于架构改进,但补丁大小——ViT 至关重要的初始设计选择——在医学领域(其中存在 2D 和 3D 成像模态)中的影响仍鲜有探讨。本研究使用来自各种成像模态的 12 个医学图像数据集(包括 7 个 2D 和 5 个 3D 数据集),彻底评估了不同补丁大小对 ViT 分类性能的影响。我们在单个 GPU 上进行精细调优,并使用一系列补丁大小(1、2、4、7、14、28),观察到较小补丁大小(1、2 和 4)在 nearly all 数据集上实现分类性能的一致性提升。具体而言,我们的结果表明,2D 数据集(补丁大小 2 与 28 之间)的平衡准确率可提高最高 12.78%,3D 数据集(补丁大小 1 与 14 之间)可提高最高 23.78%,但伴随计算开销的增加。此外,通过应用一种简单集成策略融合使用补丁大小 1、2 和 4 训练的模型预测,我们在大多数情况下进一步提升性能,尤其是针对 2D 数据集。我们的实现已公开于 GitHub: https://github.com/HealMaDe/MedViT

关键词

引用

@article{arxiv.2602.18614,
  title  = {Effect of Patch Size on Fine-Tuning Vision Transformers in Two-Dimensional and Three-Dimensional Medical Image Classification},
  author = {Massoud Dehghan and Ramona Woitek and Amirreza Mahbod},
  journal= {arXiv preprint arXiv:2602.18614},
  year   = {2026}
}

备注

29 pages