中文

通用全能模型能否与专用模型竞争?医学图像分割案例研究

图像与视频处理 2025-09-30 v2 人工智能 计算机视觉与模式识别 机器学习

摘要

能够处理多种数据模态的强大通用全能模型的出现,引发了一个关键问题:这些“万事通”系统能否在知识密集型领域与高度专业化的模型相媲美?本研究在高风险的医学图像分割领域探讨了这一问题。我们进行了一项比较研究,分析了最先进的通用全能模型(Gemini,“Nano Banana”模型)与特定领域的深度学习模型在三个不同任务上的零样本性能:息肉(内窥镜)、视网膜血管(眼底)和乳腺肿瘤分割(超声)。我们的研究通过根据专用模型的准确率筛选出“最简单”和“最困难”的案例子集,重点关注极端情况下的性能。我们的发现揭示了一个微妙且依赖于任务的格局。对于息肉和乳腺肿瘤分割,专用模型在简单样本上表现出色,但通用全能模型在专用模型灾难性失败的困难样本上表现出更强的鲁棒性。相反,对于细粒度的视网膜血管分割任务,专用模型在简单和困难案例上均保持优越性能。有趣的是,定性分析表明,通用全能模型可能具有更高的灵敏度,能够识别出人类标注者遗漏的细微解剖特征。我们的结果表明,虽然当前的通用全能模型尚不能普遍替代专用模型,但其独特的优势表明它们可能与专用模型发挥互补作用,特别是在增强具有挑战性的边缘案例的鲁棒性方面。

关键词

引用

@article{arxiv.2509.00866,
  title  = {Can General-Purpose Omnimodels Compete with Specialists? A Case Study in Medical Image Segmentation},
  author = {Yizhe Zhang and Qiang Chen and Tao Zhou},
  journal= {arXiv preprint arXiv:2509.00866},
  year   = {2025}
}

备注

15 pages, 7 figures