中文

FeatSharp:您的视觉模型特征更锐利

计算机视觉与模式识别 2025-07-04 v2

摘要

视觉编码器的特征图是众多现代 AI 任务的基础,涵盖从核心感知算法(如语义分割、目标检测、深度感知等)到现代多模态理解在视觉-语言模型(VLM)中的应用。目前计算机视觉中通用视觉骨干网络的前沿是视觉 Transformer(ViT),通常使用对比损失训练(如 CLIP)。大多数现成 ViT 模型(尤其是 CLIP)的一个关键问题是分辨率不够灵活。大多数运行在 224×224224 \times 224 像素,而所谓“高分辨率”版本大约在 378448378-448 像素,仍不够灵活。我们提出一种新方法,能够在经济方式下连贯放大低分辨率视觉编码器的特征图,同时捕捉因分辨率不足而会被遗漏的细粒度细节。我们在核心感知任务上以及在使用 RADIO 提供更丰富的蒸馏目标进行的层次化模型训练中展示了此方法的有效性。代码已公开于 https://github.com/NVlabs/FeatSharp。

关键词

引用

@article{arxiv.2502.16025,
  title  = {FeatSharp: Your Vision Model Features, Sharper},
  author = {Mike Ranzinger and Greg Heinrich and Pavlo Molchanov and Jan Kautz and Bryan Catanzaro and Andrew Tao},
  journal= {arXiv preprint arXiv:2502.16025},
  year   = {2025}
}

备注

ICML 2025 Version