中文

视觉基础模型能否增强医学图像分割中的领域泛化能力?

计算机视觉与模式识别 2024-09-13 v1 机器学习

摘要

当训练数据分布与测试数据分布相匹配时,神经网络在许多监督学习任务中取得了 SOTA 性能。然而,在领域(协变量)偏移下,其性能会显著下降,这是医学图像分割中普遍存在的问题,因为不同扫描仪型号和协议的采集设置各不相同。最近,在大规模数据集上训练的基础模型因其能够适应下游任务并在自然图像上取得具有出色泛化能力的 SOTA 性能而备受关注。然而,它们在医学图像分割中的有效性仍有待深入探索。在本文中,我们研究了各种 FMs(包括 DinoV2、SAM、MedSAM 和 MAE)在使用各种参数高效微调(PEFT)技术(如 Ladder 和 Rein (+LoRA))以及解码器头进行微调时的领域泛化性能。我们引入了一种新颖的解码器头架构 HQHSAM,它简单地将两种 SOTA 解码器头 HSAM 和 HQSAM 的元素集成在一起,以增强分割性能。我们在涵盖各种解剖结构和模态的多个数据集上进行的广泛实验表明,FMs,特别是配合 HQHSAM 解码器头,能够提高医学图像分割的领域泛化能力。此外,我们发现 PEFT 技术的有效性在不同的 FMs 中存在差异。这些发现突显了 FMs 在不同临床环境下增强医学图像分割神经网络领域泛化性能的潜力,为未来的研究奠定了坚实的基础。代码和模型可在 \url{https://github.com/kerem-cekmeceli/Foundation-Models-for-Medical-Imagery} 用于研究目的。

关键词

引用

@article{arxiv.2409.07960,
  title  = {Do Vision Foundation Models Enhance Domain Generalization in Medical Image Segmentation?},
  author = {Kerem Cekmeceli and Meva Himmetoglu and Guney I. Tombak and Anna Susmelj and Ertunc Erdil and Ender Konukoglu},
  journal= {arXiv preprint arXiv:2409.07960},
  year   = {2024}
}