中文

面向医学影像配准的视觉基础模型准备就绪吗?

图像与视频处理 2025-08-12 v2 人工智能 计算机视觉与模式识别

摘要

基础模型已在大型图像数据集上进行预训练,能够捕获丰富的特征表示,最近在零样体图像配准中展现出潜力。然而,这些模型的性能主要在刚性或结构较不复杂的场景(如大脑或腹部器官)下进行测试,是否能够处理更具挑战性的可变形解剖结构仍不明确。乳腺 MRI 配准尤其困难,因为患者之间存在显著的解剖变异,患者定位导致的变形,以及纤维乳腺组织的薄而复杂的内部结构,在准确对齐方面至关重要。是否存在基于基础模型的配准算法能够应对此种水平的复杂性仍是一个开放问题。本研究对乳腺 MRI 的基础模型配准算法进行全面评估。我们评估了包括 DINO-v2、SAM、MedSAM、SSLSAM 和 MedCLIP 在内的五个预训练编码器,涵盖不同年份、日期、序列、模态以及患者疾病状态(病灶与否)的四个关键乳腺配准任务。我们的结果表明,诸如 SAM 之类的基础模型算法在整体乳腺对齐方面优于传统配准基线,特别是在大范围域迁移情况下,但在捕获乳腺组织细节方面仍存在困难。有趣的是,MedSAM 和 SSLSAM 在医学或乳腺专用图像上进行额外预训练或微调,未能提升配准性能,在某些情况下甚至会降低性能。仍需进一步工作来理解如何影响域特定训练对配准的影响,并探索旨在提高全局对齐和细节结构精度的针对性策略。我们也在 Github 公开了代码。

关键词

引用

@article{arxiv.2507.11569,
  title  = {Are Vision Foundation Models Ready for Out-of-the-Box Medical Image Registration?},
  author = {Hanxue Gu and Yaqian Chen and Nicholas Konz and Qihang Li and Maciej A. Mazurowski},
  journal= {arXiv preprint arXiv:2507.11569},
  year   = {2025}
}

备注

3 figures, 9 pages