利用 DINOv3 基础模型适配高效注释的腹部肿块运动图像分割
计算机视觉与模式识别
2026-04-10 v1
摘要
经 ultrasound 评估腹部肿块是一项具有挑战性的临床任务,常因主观解释和显著的观察者间变异性而受到阻碍。虽然自动化分割是定量风险评估的基础步骤,但传统的完全监督卷积网络结构通常需要大量的像素级标注,且在医学影像中常见的域迁移问题上表现不佳。本文提出了一种利用预训练 DINOv3 基础视觉变换骨干网络中稳健语义先验的标签高效分割框架。通过将该骨干网络与 Dense Prediction Transformer (DPT) 风格的解码器集成,我们的方法在层次化方式下重组多尺度特征,以整合全局语义表示与细粒度空间细节。我们在 7,777 帧来自 112 名患者的临床数据集上进行评估,本方法在已建立的完全监督基线(包括 U-Net、U-Net++、DeepLabV3 和 MAnet)中实现了最先进的性能。具体而言,我们获得了 Dice 评分为 0.945,并在边界遵循方面取得改进,使 95 百分位 Hausdorff Distance 相对于最强卷积基线降低了 11.4%。此外,我们进行了大规模的效率分析,表明 DINOv3 方法在数据匮乏情境下保持显著更高的性能,即使仅使用 25% 的数据进行训练,仍能保持强大的效果。这些结果表明,利用大规模自监督基础模型为数据受限临床环境中的医学图像分割提供了一条有前景且数据高效的解决方案。项目仓库:https://github.com/FrancescaFati/MESA
引用
@article{arxiv.2604.08045,
title = {Adapting Foundation Models for Annotation-Efficient Adnexal Mass Segmentation in Cine Images},
author = {Francesca Fati and Alberto Rota and Adriana V. Gregory and Anna Catozzo and Maria C. Giuliano and Mrinal Dhar and Luigi De Vitis and Annie T. Packard and Francesco Multinu and Elena De Momi and Carrie L. Langstraat and Timothy L. Kline},
journal= {arXiv preprint arXiv:2604.08045},
year = {2026}
}