中文

GuiDINO:重新思考医学图像分割中的视觉基础模型

计算机视觉与模式识别 2026-03-03 v1

摘要

基础视觉模型正在医学图像分析中获得广泛应用。由于领域迁移,这些预训练模型在未完全微调或轻度适应的情况下与医学图像分割需求不匹配。我们引入 GuiDINO 框架,将原生基础模型重新定位为面向下游分割的视觉指导生成器。GuiDINO 从 DINOv3 提取视觉特征表示,并通过轻量级 TokenBook 机制将其转换为空间指导掩码,该机制聚合 token-原型相似性。该指导掩码对多个分割主干网络的特征激活进行门控,从而在注入基础模型先验的同时保留医学专用架构的归纳偏置和效率。训练依赖于指导监督目标损失,将指导掩码与真实标签区域对齐,可选用以锐化细节结构的边界聚焦 hinge 损失。GuiDINO 还支持通过 LoRA 对 DINOv3 指南主干进行参数高效适应。跨越 diverse 医学数据集和 nnUNet 风格推理,GuiDINO 持续改善分割质量和边界鲁棒性,表明这是一种实用的微调替代方案,为如何最佳服务医学视觉提供了新的视角。代码可在 https://github.com/Hi-FishU/GuiDINO 获取。

关键词

引用

@article{arxiv.2603.01115,
  title  = {GuiDINO: Rethinking Vision Foundation Model in Medical Image Segmentation},
  author = {Zhuonan Liang and Wei Guo and Jie Gan and Yaxuan Song and Runnan Chen and Hang Chang and Weidong Cai},
  journal= {arXiv preprint arXiv:2603.01115},
  year   = {2026}
}

备注

12 pages, 2 figures, 3 tables