多样性优于规模:全切片图像多样性使得H&E基础模型训练只需更少图块
组织与器官
2025-11-14 v1
摘要
计算病理学的快速进展日益受到在海量组织病理学数据集上预训练的视觉基础模型的驱动。虽然近期研究优先考虑在数量不断增多的图块上进行训练,但我们采取了一种侧重于数据多样性的替代方法。我们的基础模型Athena从预训练模型初始化,仅使用1.15亿个组织图块进行训练,比近期组织病理学基础模型少了几倍。我们不依赖图块数量或复杂的采样启发式方法,而是通过从我们多样化的内部存储库(涵盖多个国家、机构和扫描仪类型)中,为每张全切片图像仅随机选择中等数量的图块,来最大化数据多样性。在单个图块级基准测试和四项切片级下游任务(两项分子任务和两项形态学任务)上的评估表明,Athena接近最先进水平,甚至超越了多个在更大数据集上训练的模型。这表明,全切片图像之间的多样性,而非单纯的图块数量,驱动着组织病理学基础模型的学习。
引用
@article{arxiv.2511.10286,
title = {Diversity Over Scale: Whole-Slide Image Variety Enables H&E Foundation Model Training with Fewer Patches},
author = {Christoph Bosch and John K. L. Wong and Martin Paulikat and Myroslav Zapukhlyak and Bharti Arora and Manasi Aichmüller-Ratnaparkhe and Jens Baumann and Shivani Karn and Rutuja Kamble and Swapnil Karnik and Bhushan Khedkar and Serey Vathana Chhut and Witali Aswolinskiy and Christian Aichmüller},
journal= {arXiv preprint arXiv:2511.10286},
year = {2025}
}