通用视觉模型是否足以用于 2D 医学图像分割?基于跨数据集的实证研究
计算机视觉与模式识别
2026-03-16 v1 人工智能
摘要
医学图像分割 (MIS) 是计算机辅助诊断和临床决策支持系统的基本组成部分。过去十年间,诸多专为医学成像设计的体系结构涌现,以解决低对比度、小解剖结构以及有限标注数据等领域特定挑战。与此同时,计算机视觉领域的快速进步产生了大量高性能通用视觉模型 (GP-VM),这些模型最初为自然图像设计。尽管这些模型在标准视觉基准测试中表现出色,但其在 MIS 领域的有效性仍不充分了解。本文进行受控实证研究,检验是否专用医学分割体系结构 (SMA) 在 2D MIS 中提供系统性优势。我们使用统一的训练与评估协议,对比 11 种 SMA 和 GP-VM。实验在覆盖不同成像模态、类别结构和数据特征的三个异构数据集上进行。除分段准确率外,我们还分析定性 Grad-CAM 可视化,以探讨可解释性 (XAI) 行为。我们的结果表明,针对所分析数据集,GP-VM 在大多数专用 MIS 模型中取得优势。此外,XAI 分析表明,GP-VM 可在无需显式领域特定体系结构设计的情况下捕获临床相关结构。这些发现表明,GP-VM 可代表专用方法的可行替代方案,凸显了为端到端 MIS 系统进行明智模型选择的重要性。所有代码和资源均已在 GitHub 上提供。
引用
@article{arxiv.2603.13044,
title = {Are General-Purpose Vision Models All We Need for 2D Medical Image Segmentation? A Cross-Dataset Empirical Study},
author = {Vanessa Borst and Samuel Kounev},
journal= {arXiv preprint arXiv:2603.13044},
year = {2026}
}
备注
Under review, MICCAI 2026