中文

利用基础模型应对数据稀缺:医学影像中小样本与零样本学习方法的基准评测

计算机视觉与模式识别 2024-08-16 v1 人工智能 机器学习

摘要

数据稀缺是将现代机器学习技术应用于临床任务的主要限制因素。尽管对于一些研究充分的医学任务存在足够的数据,但仍有大量临床相关任务的数据可用性很差。最近,许多基础模型已展现出对少样本学习(FSL)和零样本学习(ZSL)的高度适用性,这可能使它们更易于被从业者使用。然而,目前尚不清楚哪种基础模型在 FSL 医学图像分析任务上表现最佳,以及从有限数据中学习的最佳方法是什么。我们使用 16 个预训练基础模型在 19 个不同的医学影像数据集上对 ZSL 和 FSL 进行了全面的基准测试研究。我们的结果表明,对于非常小的训练集规模,仅在医学数据上预训练的模型 BiomedCLIP 平均表现最佳,而在训练样本稍多时,在 LAION-2B 上预训练的非常大的 CLIP 模型表现最佳。然而,当每个类别有超过五个训练样本时,简单地微调在 ImageNet 上预训练的 ResNet-18 也能获得类似的性能。我们的发现还强调了需要进一步研究专门为医学应用定制的基础模型,并收集更多数据集来训练这些模型。

关键词

引用

@article{arxiv.2408.08058,
  title  = {Navigating Data Scarcity using Foundation Models: A Benchmark of Few-Shot and Zero-Shot Learning Approaches in Medical Imaging},
  author = {Stefano Woerner and Christian F. Baumgartner},
  journal= {arXiv preprint arXiv:2408.08058},
  year   = {2024}
}

备注

Accepted as an oral presentation in MICCAI 2024 2nd International Workshop on Foundation Models for General Medical AI