中文

LoftUp:面向视觉基础模型的基于坐标的特征上采样学习

计算机视觉与模式识别 2025-04-22 v1 人工智能 机器学习 图像与视频处理

摘要

视觉基础模型(VFM)如DINOv2和CLIP在various downstream tasks上取得了令人瞩目的成绩,但其受限的特征分辨率阻碍了需要像级理解的应用。特征上采样为解决这一挑战提供了可行的方向。本文识别了增强特征上采样的两个关键因素:上采样架构和训练目标。对于上采样架构,我们引入一种基于坐标的交叉注意力转换器,将高分辨率图像坐标与低分辨率VFM特征相结合,以生成清晰、高质量的特征。对于训练目标,我们提出了通过利用类别无关掩码和自蒸馏构建高分辨率伪groundtruth特征。我们的方法有效捕获细粒度细节,并灵活适应各种输入和特征分辨率。在实验中,我们展示了该方法在various downstream tasks上显著优于现有特征上采样技术。我们的代码已发布于https://github.com/andrehuang/loftup。

关键词

引用

@article{arxiv.2504.14032,
  title  = {LoftUp: Learning a Coordinate-Based Feature Upsampler for Vision Foundation Models},
  author = {Haiwen Huang and Anpei Chen and Volodymyr Havrylov and Andreas Geiger and Dan Zhang},
  journal= {arXiv preprint arXiv:2504.14032},
  year   = {2025}
}