只需 OCT 数据:视觉 Transformer 是否有前置预训练对成像效能有益?
计算机视觉与模式识别
2025-02-19 v1 机器学习
摘要
光学相干断层扫描(OCT)提供高分辨率横截面图像, 用于诊断多种疾病, 但其与自然图像的差异特性引发疑问: 大规模在 ImageNet 等数据集上进行预训练是否始终有益。本文探究 ImageNet 预训练对视觉 Transformer(ViT)在 OCT 图像分类中的影响, 实验覆盖四类视网膜病理(CNV、DME、黄体样囊肿、正常)。结果表明, 虽预训练可加速收敛并在小数据集上提供潜在优势, 当获得充足 OCT 数据时, 从头训练可能实现相当乃至更高的准确率。我们的发现凸显域特性匹配性在预训练中的重要性, 并呼吁进一步研究大规模面向 OCT 的特定预训练方案。
关键词
引用
@article{arxiv.2502.12379,
title = {OCT Data is All You Need: How Vision Transformers with and without Pre-training Benefit Imaging},
author = {Zihao Han and Philippe De Wilde},
journal= {arXiv preprint arXiv:2502.12379},
year = {2025}
}