基于度量引导的视觉基石模型特征融合用于分割任务
计算机视觉与模式识别
2026-05-19 v1 人工智能
摘要
尽管大规模视觉基石模型(VFM)在语义理解方面取得了显著性能,但在实例感知密集预测任务中仍表现不佳。它们在表示偏差方面存在差异:例如,提示驱动的分割模型(如 SAM2)侧重于细粒度区域边界,而自监督模型(如 DINOv3)则强调对象级别的结构。这一观察凸显了结合不同 VFM 互补特征以增强下游密集预测任务的潜力。然而,朴素的多 VFM 融合很少能获得可靠的提升,如何利用其互补特征仍缺乏可解释的原则。本文提出一种度量引导的方法,依据明确的评估分数有效选择并聚合来自不同 VFM 的互补特征。具体而言,我们设计了基于标签无关指标的特征空间评估框架,涵盖结构一致性和边缘保真度两个方面,用于评估 VFM 编码器的特征。借助这些分数,我们识别出边缘强和结构强的编码器配对,并通过主辅融合方案进行集成。该特征融合无需复杂的架构修改,仅需单阶段训练。我们的模型在多个密集预测任务上均实现了持续的性能提升,表现出更好的对象级语义和更精确的边界定位。代码已公开于 {https://github.com/gyc-code/metric-guided-fusion}。
引用
@article{arxiv.2605.16864,
title = {Metric-Guided Feature Fusion of Visual Foundation Models for Segmentation Tasks},
author = {Yachan Guo and JoseLuis Gomez Zurita and Danna Xue and Yi Xiao and AntonioManuel Lopez Pena},
journal= {arXiv preprint arXiv:2605.16864},
year = {2026}
}
备注
Accepted to the CVPR 2026 Findings Track