中文

BioVFM-21M:面向生物医学图像分析的自监督视觉基础模型的基准测试与缩放研究

计算机视觉与模式识别 2025-05-15 v1 人工智能

摘要

扩大模型和数据规模在广泛的任务中展现出了令人印象深刻的性能提升。尽管对通用任务的缩放行为进行了广泛研究,但医学图像与自然数据存在显著差异。由于缺乏对医学领域缩放行为的深入理解,目前尚不清楚大规模开发医学视觉基础模型的关键因素。在本文中,我们通过自监督学习,在模型大小、训练算法、数据大小和成像模态方面探索了开发可扩展医学视觉基础模型时的缩放行为。为了支持可扩展的预训练,我们引入了 BioVFM-21M,这是一个大规模生物医学图像数据集,涵盖了广泛的生物医学图像模态和解剖结构。我们观察到,扩大规模确实带来了好处,但因任务而异。进一步的分析揭示了与缩放收益相关的几个因素。最后,我们提出了 BioVFM,这是一个在 2100 万张生物医学图像上预训练的大规模医学视觉基础模型,它在 12 个医学基准上优于先前 state-of-the-art 的基础模型。我们的结果强调,虽然扩大规模有助于追求更好的性能,但任务特征、数据多样性、预训练方法和计算效率仍然是开发可扩展医学基础模型的关键考虑因素。

关键词

引用

@article{arxiv.2505.09329,
  title  = {BioVFM-21M: Benchmarking and Scaling Self-Supervised Vision Foundation Models for Biomedical Image Analysis},
  author = {Jiarun Liu and Hong-Yu Zhou and Weijian Huang and Hao Yang and Dongning Song and Tao Tan and Yong Liang and Shanshan Wang},
  journal= {arXiv preprint arXiv:2505.09329},
  year   = {2025}
}

备注

11 pages, 4 figures