中文

DINOv3是否设定了新的医学视觉标准?基准测试2D和3D分类、分割与配准

计算机视觉与模式识别 2026-01-21 v3

摘要

大规模视觉基础模型预训练于多样化自然图像,已在计算机视觉中引发范式转变。然而,前沿视觉基础模型效能如何迁移到专业领域如医学成像中仍是未知问题。本报告调查DINOv3——一种在自然图像上进行自监督预训练的领先视觉Transformer(ViT)——是否可直接作为无需领域特定微调即可服务于医学视觉任务的强大统一编码器。为此,我们在广泛医学成像模态上,对DINOv3进行2D和3D分类、分割和配准基准测试。我们系统性地分析其可扩展性,通过变化模型规模和输入图像分辨率进行验证。我们的发现表明,DINOv3表现出色,建立了强大的新基准。令人惊讶的是,它甚至在多个任务上超越了BiomedCLIP和CT-Net等医学专用基础模型,尽管仅在自然图像上进行训练。然而,我们识别出明确局限性:该模型在需要深层领域专业化的场景中(如全切片图像(WSIs)、电子显微镜(EM)和正电子断象扫描(PET))的特征会下降。此外,我们观察到DINOv3在医学领域不遵循规模定律,其性能随模型增大或特征分辨率更细并不稳定地提升,在不同任务中表现出多样化的规模行为。总体而言,本工作将DINOv3确立为强大的基准,其强大的视觉特征可为多种医学任务提供稳健的先验,为利用其特征在3D重建中实现多视图一致性等前景方向敞开了可能。

关键词

引用

@article{arxiv.2509.06467,
  title  = {Does DINOv3 Set a New Medical Vision Standard? Benchmarking 2D and 3D Classification, Segmentation, and Registration},
  author = {Che Liu and Yinda Chen and Haoyuan Shi and Jinpeng Lu and Bailiang Jian and Jiazhen Pan and Linghan Cai and Jiayi Wang and Jieming Yu and Ziqi Gao and Xiaoran Zhang and Long Bai and Yundi Zhang and Jun Li and Cosmin I. Bercea and Cheng Ouyang and Chen Chen and Zhiwei Xiong and Benedikt Wiestler and Christian Wachinger and James S. Duncan and Daniel Rueckert and Wenjia Bai and Rossella Arcucci},
  journal= {arXiv preprint arXiv:2509.06467},
  year   = {2026}
}

备注

Technical Report