中文

MuRF: 释放视觉基础模型的多尺度潜力

计算机视觉与模式识别 2026-04-06 v2

摘要

视觉基础模型(VFMs)已成为现代计算机视觉的基石,为广泛的任务提供鲁棒的表示。虽然最近的进展允许这些模型在训练期间处理不同的输入大小,但推理通常仍局限于单一固定尺度。这种普遍的单尺度范式忽略了视觉感知的一个基本属性:不同的分辨率提供互补的归纳偏置,其中低分辨率视图擅长全局语义识别,而高分辨率视图对于细粒度细化至关重要。在这项工作中,我们提出了多分辨率融合(MuRF),一种简单而通用的策略,用于在推理时利用这种协同效应。MuRF不依赖单一视图,而是通过在冻结的VFM中以多种分辨率处理图像并融合所得特征来构建统一的表示。MuRF的通用性是其最引人注目的属性。它不绑定于特定架构,而是作为视觉表示的基本、无训练增强。我们通过在多个不同VFM家族——主要是DINOv2,但也展示了向对比模型如SigLIP2的成功泛化——上的广泛关键计算机视觉任务上的应用经验证了这一点。

关键词

引用

@article{arxiv.2603.25744,
  title  = {MuRF: Unlocking the Multi-Scale Potential of Vision Foundation Models},
  author = {Bocheng Zou and Mu Cai and Mark Stanley and Dingfu Lu and Yong Jae Lee},
  journal= {arXiv preprint arXiv:2603.25744},
  year   = {2026}
}

备注

Project Page: https://murf-vfm.github.io/