中文

评估用于医学图像分析的通用视觉基础模型:DINOv2 在放射学基准上的实验研究

计算机视觉与模式识别 2024-09-17 v4 人工智能

摘要

深度学习系统在医疗保健领域的整合一直受到数据标注过程资源密集以及这些系统无法泛化到不同数据分布的阻碍。基础模型是在大型数据集上预训练的模型,已成为减少对标注数据依赖并增强模型泛化能力和鲁棒性的解决方案。DINOv2 是一个开源基础模型,通过自监督学习在 1.42 亿张精选自然图像上进行预训练,在各种视觉任务中展现出良好的能力。然而,关于 DINOv2 对放射学成像的适应性,以及其特征是否足够通用以有益于放射学图像分析,一个关键问题仍未得到解答。因此,本研究全面评估了 DINOv2 在放射学中的性能,在不同模态(X 射线、CT 和 MRI)上进行了 200 多次评估。为了衡量 DINOv2 特征表示的有效性和泛化性,我们在包括 2D 和 3D 图像上的疾病分类和器官分割等医学图像分析任务中,以及在 kNN、少样本学习、线性探测、端到端微调和参数高效微调等不同设置下分析了该模型。与成熟的监督、自监督和弱监督模型的比较分析揭示了 DINOv2 的卓越性能和跨任务泛化能力。研究结果为优化医学成像预训练策略的潜在途径提供了见解,并增进了对 DINOv2 在弥合自然图像与放射学图像分析之间差距方面作用的更广泛理解。我们的代码可在 https://github.com/MohammedSB/DINOv2ForRadiology 获取

关键词

引用

@article{arxiv.2312.02366,
  title  = {Evaluating General Purpose Vision Foundation Models for Medical Image Analysis: An Experimental Study of DINOv2 on Radiology Benchmarks},
  author = {Mohammed Baharoon and Waseem Qureshi and Jiahong Ouyang and Yanwu Xu and Abdulrhman Aljouie and Wei Peng},
  journal= {arXiv preprint arXiv:2312.02366},
  year   = {2024}
}