重访二维基础模型以实现可扩展的三维医学图像分类
计算机视觉与模式识别
2026-05-28 v3
摘要
三维医学图像分类是现代临床工作流的关键。医学基础模型(FMs)作为扩展至新任务的有前景方法已兴起,但当前研究存在三个关键缺陷:数据分布偏差、自适应不充分和任务覆盖不足。本文针对这些缺陷提出了AnyMC3D,一个从二维FMs适配的可扩展三维分类器。我们的方法通过仅在单个冻结骨干网络之上添加轻量插件(每个任务约1M参数)即可高效扩展至新任务。该通用框架还支持多视角输入、辅助像素级监督和可解释热力图生成。我们建立了涵盖多样病理、解剖结构和模态的12项任务的综合基准,并系统分析了最先进的3D分类技术。我们的分析揭示了关键洞察:(1)有效的自适应是释放基础模型潜力的关键,(2)通用基础模型若适配得当可以匹敌医学专用基础模型,(3)基于二维的方法在三维分类上优于三维架构。我们首次证明了使用单一可扩展框架即可在多样化应用中达到最先进性能(包括VLM3D挑战赛第一名),无需单独的任务特定模型。
引用
@article{arxiv.2512.12887,
title = {Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification},
author = {Han Liu and Bogdan Georgescu and Yanbo Zhang and Youngjin Yoo and Michael Baumgartner and Riqiang Gao and Jianing Wang and Gengyan Zhao and Eli Gibson and Dorin Comaniciu and Sasa Grbic},
journal= {arXiv preprint arXiv:2512.12887},
year = {2026}
}
备注
1st Place in VLM3D Challenge