半监督与自监督学习用于医学图像分类的系统比较
计算机视觉与模式识别
2024-04-02 v3 机器学习
摘要
在典型的医学图像分类问题中,有标签数据稀缺而无标签数据更为充足。半监督学习与自监督学习是两个不同的研究方向,可通过从额外无标签数据中学习来提高准确率。来自两个方向的近期方法在传统基准上均报告了显著增益。然而,过去的基准并未聚焦于医学任务,且很少将自监督与半监督方法置于同等条件下进行比较。此外,过去的基准往往在超参数调优上处理欠佳。首先,它们可能完全不调优超参数,导致欠拟合。其次,当进行调优时,往往不切实际地使用远大于训练集的有标签验证集。因此,当前已发布的排名未必与其实际效用相符。本研究贡献了一个自监督与半监督方法的系统评估,采用统一的实验协议,旨在指导整体有标签数据稀缺且计算预算有限的实践者。我们回答两个关键问题:超参数调优在现实规模的验证集下是否有效?若有效,当所有方法均被良好调优时,哪些自监督或半监督方法取得最佳准确率?我们的研究在 4 个医学数据集上将 13 种代表性半监督与自监督方法与强仅标签集基线进行比较。基于 20000+ GPU 小时的计算,我们向资源受限的实践者提供了宝贵的最佳实践:超参数调优是有效的,且称为 MixMatch 的半监督方法在 4 个数据集上带来了最可靠的增益。
引用
@article{arxiv.2307.08919,
title = {Systematic comparison of semi-supervised and self-supervised learning for medical image classification},
author = {Zhe Huang and Ruijie Jiang and Shuchin Aeron and Michael C. Hughes},
journal= {arXiv preprint arXiv:2307.08919},
year = {2024}
}
备注
CVPR 2024