医学基础模型的特征质量与适应性:面向放射学分类与分割的比较评估
计算机视觉与模式识别
2025-11-14 v1 人工智能
摘要
基础模型(FMs)有望泛化医学影像,但其有效性各不相同。目前尚不清楚预训练领域(医学 vs. 通用)、范式(例如,文本引导)和架构如何影响嵌入质量,这阻碍了为特定放射学任务选择最优编码器。为解决此问题,我们评估了来自八个医学和通用领域基础模型的视觉编码器,用于胸部X光分析。我们使用线性探测和微调来基准测试分类(气胸、心脏肥大)和分割(气胸、心脏边界)任务。我们的结果表明,领域特定的预训练提供了显著优势;在线性探测中,医学基础模型始终优于通用领域模型,确立了卓越的初始特征质量。然而,特征效用高度依赖于任务。预训练嵌入对于全局分类和分割显著解剖结构(例如,心脏)表现强劲。相比之下,对于分割复杂、微妙的病理(例如,气胸),所有基础模型在没有大量微调的情况下表现不佳,揭示了在定位细微病变方面的关键差距。亚组分析表明,基础模型在分类时使用混淆捷径(例如,使用胸管检测气胸),这种策略在精确分割时失效。我们还发现,昂贵的文本-图像对齐并非先决条件;纯图像(RAD-DINO)和标签监督(Ark+)基础模型是表现最佳的模型之一。值得注意的是,一个监督式的端到端基线仍然具有很强的竞争力,在分割任务上匹配或超过了最佳基础模型。这些发现表明,虽然医学预训练是有益的,但架构选择(例如,多尺度)至关重要,并且预训练特征并非普遍有效,尤其是在复杂的定位任务中,监督模型仍然是强有力的替代方案。
引用
@article{arxiv.2511.09742,
title = {Feature Quality and Adaptability of Medical Foundation Models: A Comparative Evaluation for Radiographic Classification and Segmentation},
author = {Frank Li and Theo Dapamede and Mohammadreza Chavoshi and Young Seok Jeon and Bardia Khosravi and Abdulhameed Dere and Beatrice Brown-Mulry and Rohan Satya Isaac and Aawez Mansuri and Chiratidzo Sanyika and Janice Newsome and Saptarshi Purkayastha and Imon Banerjee and Hari Trivedi and Judy Gichoya},
journal= {arXiv preprint arXiv:2511.09742},
year = {2025}
}
备注
7 figures, 3 tables