MedDINOv3:如何为医学图像分割调整视觉基础模型?
计算机视觉与模式识别
2025-10-16 v3
摘要
对器官和肿瘤在 CT 和 MRI 扫描中的准确分割对于诊断、治疗规划和疾病监测至关重要。尽管深度学习已推动了自动化分割,但大多数模型仍是 task-specific 的,缺乏跨模态和跨机构的通用性。基于千亿级自然图像预训练的视觉基础模型 (FMs) 提供了强大且可迁移的表示。然而,将其适用于医学成像面临两个关键挑战:(1) 大多数基础模型的 ViT backbone 在医学图像分割方面仍不够表现优于专用 CNN,(2) 自然图像和医学图像之间的大范围 domain gap 限制了可迁移性。我们引入 MedDINOv3,一个简单而有效的框架,用于适配 DINOv3 以用于医学分割。我们首先重访 plain ViT,设计一个简单有效的架构以实现 multi-scale token 聚合。然后,我们在 CT-3M 上进行 domain-adaptive 预训练,该数据集包含 3.87M axial CT 切片,采用 multi-stage DINOv3 配方以学习鲁棒的稠密特征。MedDINOv3 在四个分割基准测试中实现或超越最新性能,展示了视觉基础模型作为医学图像分割统一 backbone 的潜力。代码已公开:https://github.com/ricklisz/MedDINOv3
引用
@article{arxiv.2509.02379,
title = {MedDINOv3: How to adapt vision foundation models for medical image segmentation?},
author = {Yuheng Li and Yizhou Wu and Yuxiang Lai and Mingzhe Hu and Xiaofeng Yang},
journal= {arXiv preprint arXiv:2509.02379},
year = {2025}
}