面向小体量病理基准微调的大规模病理图像预训练
计算机视觉与模式识别
2023-06-14 v2 机器学习
图像与视频处理
摘要
在大型图像数据集上预训练深度学习模型,然后在小型目标数据集上微调,是标准步骤。大型数据集通常为通用图像(如 imagenet2012),而小型数据集可以是与大型数据集分布不同的专用数据集。然而,当大型数据集为专用且与小型数据集分布相似时,这种“大-to-小”策略尚未得到充分验证。我们新编译了三个苏木精-伊红染色图像数据集:一个大型数据集(PTCGA200)和两个放大倍率调整后的小型数据集(PCam200 和 segPANDA200)。采用监督与自监督学习方法训练主要深度学习模型,并在小型数据集上微调以进行肿瘤分类和组织分割基准测试。在 PTCGA200 上以 MoCov2、SimCLR 和 BYOL 预训练的 ResNet50,微调于 PTCGA200 时优于 imagenet2012 预训练(准确率分别为 83.94%、86.41%、84.91% 和 82.72%)。在 PTCGA200 上以 MoCov2 预训练的 ResNet50 超越了 COCOtrain2017 预训练基线,并在 ResNet50 中取得组织分割基准最佳结果(mIoU 分别为 63.53% 和 63.22%)。我们发现,在 PTCGA200 上重新训练 imagenet 预训练模型(ResNet50、BiT-M-R50x1 和 ViT-S/16)可改善下游基准表现。
引用
@article{arxiv.2303.15693,
title = {Large-scale pretraining on pathological images for fine-tuning of small pathological benchmarks},
author = {Masataka Kawai and Noriaki Ota and Shinsuke Yamaoka},
journal= {arXiv preprint arXiv:2303.15693},
year = {2023}
}
备注
20 pages, 6 figures