DSU-Net:基于 DINOv2 和 SAM2 多尺度跨模型特征增强的改进 U-Net 模型
计算机视觉与模式识别
2025-04-01 v2
摘要
尽管大规模预训练基础模型(如 Meta 的 Segment Anything Model (SAM) 系列和 DINOv2)在通用图像分割方面取得了显著进展,但其在特定领域的性能仍受限于两个关键问题:由于大模型参数导致的训练成本过高,以及不足以代表特定领域特征的能力。本文提出一个由 DINOv2 引导 SAM2 的多尺度特征协作框架,核心创新体现在三个方面:(1) 在 DINOv2 和 SAM2 主干之间建立特征协作机制,其中由自监督模型提取的高维语义特征引导多尺度特征融合;(2) 设计轻量级适配器模块和跨模态、跨层特征融合单元,以注入跨域知识的同时冻结基础模型参数;(3) 基于 U-net 构建 U 形网络结构,该结构利用注意力机制实现多粒度特征的自适应聚合解码。该框架在下游任务如伪装目标检测和显著目标检测中超越了现有的 SOTA 方法,无需高昂的训练过程。它为视觉图像分割的高效部署提供了技术路径,展示了在广泛的下游任务和图像分割的特定领域中具有显著的应用价值。
引用
@article{arxiv.2503.21187,
title = {DSU-Net:An Improved U-Net Model Based on DINOv2 and SAM2 with Multi-scale Cross-model Feature Enhancement},
author = {Yimin Xu and Fan Yang and Bin Xu},
journal= {arXiv preprint arXiv:2503.21187},
year = {2025}
}