Dino U-Net:利用基础模型获取高保真稠密特征进行医学图像分割
计算机视觉与模式识别
2026-05-11 v2 图像与视频处理
摘要
大规模自然图像数据集预训练的基础模型为医学图像分割提供了强大的范式。然而,有效地将其学习到的表征用于精确的临床应用仍具有挑战性。在本工作中,我们提出了 Dino U-Net,这是一种新颖的编码器-解码器架构,旨在利用 DINOv3 视觉基础模型获取高保真稠密特征。我们的架构引入了基于冻结 DINOv3 主干网络的编码器,该编码器采用专用的适配器来融合模型的丰富语义特征与低层空间细节。为保持这些表征在降维过程中的质量,我们设计了新的保真感知投影模块(FAPM),有效地细化并投影特征供解码器使用。我们在七个多样化的公开医学图像分割数据集上进行了大量实验。我们的結果显示,Dino U-Net 实现了最先进的性能,在各种影像模态上均一致优于先前方法。我们的框架表现出高度的可扩展性,随着主干模型规模的增加(直到 70 亿参数变体),分割精度持续提升。这些发现表明,利用来自通用基础模型的优越稠密预训练特征,为提高医学图像分割精度提供了高度有效且参数高效的方法。代码已公开于 https://github.com/yifangao112/DinoUNet。
引用
@article{arxiv.2508.20909,
title = {Dino U-Net: Exploiting High-Fidelity Dense Features from Foundation Models for Medical Image Segmentation},
author = {Haoyue Li and Yifan Gao and Feng Yuan and Xiaosong Wang and Xin Gao},
journal= {arXiv preprint arXiv:2508.20909},
year = {2026}
}
备注
MICCAI 2026