DinoBloom:用于血液学中可泛化细胞嵌入的基础模型
计算机视觉与模式识别
2024-04-09 v1 机器学习
摘要
在血液学中,计算模型在提升诊断准确性、优化工作流程以及减少分析外周血或骨髓涂片中单细胞的繁琐工作方面具有巨大潜力。然而,由于严重的批次效应、数据集规模小以及从自然图像迁移学习性能不佳导致的泛化能力缺乏,阻碍了计算模型的临床应用。为应对这些挑战,我们引入了 DinoBloom,这是血液学中首个针对单细胞图像的基础模型,利用了定制的 DINOv2 流程。我们的模型建立在 13 个多样化且公开可用的外周血和骨髓涂片数据集的广泛集合之上,这是迄今为止血液学中最大规模的开源队列,包含超过 380,000 张白细胞图像。为评估其泛化能力,我们在一个具有挑战性域偏移的外部数据集上对其进行了评估。结果表明,我们的模型在以下方面大幅优于现有的医学与非医学视觉模型: 血液和骨髓涂片上细胞类型分类的线性探测与 k 近邻评估; 急性髓系白血病亚型的弱监督多实例学习。一系列四种 DinoBloom 模型(small、base、large 和 giant)可适应广泛的下游应用,作为分类问题的强基线,并促进新数据集中批次效应的评估。所有模型均可在 github.com/marrlab/DinoBloom 获取。
引用
@article{arxiv.2404.05022,
title = {DinoBloom: A Foundation Model for Generalizable Cell Embeddings in Hematology},
author = {Valentin Koch and Sophia J. Wagner and Salome Kazeminia and Ece Sancar and Matthias Hehr and Julia Schnabel and Tingying Peng and Carsten Marr},
journal= {arXiv preprint arXiv:2404.05022},
year = {2024}
}