中文

SegDINO:基于 DINO-V3 的医学与自然图像高效分割设计

计算机视觉与模式识别 2025-09-03 v1

摘要

DINO 系列自监督视觉模型展现出卓越的可迁移性,但如何有效适配其表征以用于分割任务仍具挑战。现有方法通常依赖带有多尺度融合或复杂上采样的重型解码器,这引入了大量参数开销和计算成本。本文提出 SegDINO,一个将冻结的 DINOv3 骨干网络与轻量级解码器相结合的高效分割框架。SegDINO 从预训练编码器中提取多层次特征,将其对齐至统一分辨率和通道宽度,并利用轻量级 MLP 头直接预测分割掩码。该设计在最小化可训练参数的同时,保留了基础模型特征的表示能力。在六个基准数据集上的广泛实验,包括三个医学数据集(TN3K、Kvasir-SEG、ISIC)和三个自然图像数据集(MSD、VMD-D、ViSha),表明 SegDINO 相比现有方法持续达到最先进的性能。代码见 https://github.com/script-Yang/SegDINO。

关键词

引用

@article{arxiv.2509.00833,
  title  = {SegDINO: An Efficient Design for Medical and Natural Image Segmentation with DINO-V3},
  author = {Sicheng Yang and Hongqiu Wang and Zhaohu Xing and Sixiang Chen and Lei Zhu},
  journal= {arXiv preprint arXiv:2509.00833},
  year   = {2025}
}