中文

利用对比与掩码自编码器方法进行自监督预训练以应对医学影像深度学习中的小数据集问题

计算机视觉与模式识别 2023-11-28 v4 人工智能 机器学习

摘要

医学影像中的深度学习有潜力降低诊断错误风险、减轻放射科医生工作负担并加速诊断。训练此类深度学习模型需要大规模且准确的数据集,并为所有训练样本提供标注。然而,在医学影像领域,由于标注高度复杂、获取受限或疾病罕见,针对特定任务的标注数据集往往较小。为应对这一挑战,可利用自监督学习领域的方法在大规模无标注图像数据集上对深度学习模型进行预训练。预训练后,仅需少量标注数据集即可将模型微调至特定任务。医学影像中最流行的自监督预训练方法基于对比学习。然而,自然图像处理的最新研究表明掩码自编码器方法具有巨大潜力。本文在医学图像上,将最先进的对比学习方法与近期提出的面向卷积神经网络(CNNs)的掩码自编码器方法“SparK”进行比较。为此,我们在一个大规模无标注CT图像数据集上预训练,并在多个CT分类任务上微调。鉴于医学影像中获取充足标注训练数据的挑战,评估自监督预训练方法在小型数据集上微调时的表现尤为关键。通过逐步缩减微调训练数据集规模的实验,我们发现缩减的影响因所选预训练类型而异。SparK预训练方法比对比方法对训练数据集规模更具鲁棒性。基于我们的结果,我们建议在仅含小型标注数据集的医学影像任务中使用SparK预训练。

关键词

引用

@article{arxiv.2308.06534,
  title  = {Self-Supervised Pre-Training with Contrastive and Masked Autoencoder Methods for Dealing with Small Datasets in Deep Learning for Medical Imaging},
  author = {Daniel Wolf and Tristan Payer and Catharina Silvia Lisson and Christoph Gerhard Lisson and Meinrad Beer and Michael Götz and Timo Ropinski},
  journal= {arXiv preprint arXiv:2308.06534},
  year   = {2023}
}

备注

Accepted in Nature Scientific Reports