Upsample Anything: 特征上采样的简单且难以超越的基准方法
计算机视觉与模式识别
2025-11-25 v2
摘要
我们提出了\textbf{Upsample Anything},一个轻量级的测试时优化(TTO)框架,无需任何训练即可将低分辨率特征恢复为高分辨率的逐像素输出。尽管视觉基础模型在多样化的下游任务中表现出强大的泛化能力,但其表示通常被下采样14倍/16倍(例如ViT),这限制了其在像素级应用中的直接使用。现有的特征上采样方法依赖于数据集特定的重新训练或沉重的隐式优化,限制了可扩展性和泛化性。Upsample Anything通过每图像简单优化,学习一个结合空间和范围线索的各向异性高斯核,有效桥接高斯溅射和联合双边上采样。学习到的核作为一种通用的、边缘感知算子,可无缝跨架构和模态迁移,实现对特征、深度或概率图的精确高分辨率重建。该方法在每张224×224图像上仅需约,在语义分割、深度估计以及深度和概率图上采样方面均达到最先进的性能。\textbf{项目页面:}\href{https://seominseok0429.github.io/Upsample-Anything/}{https://seominseok0429.github.io/Upsample-Anything/}
引用
@article{arxiv.2511.16301,
title = {Upsample Anything: A Simple and Hard to Beat Baseline for Feature Upsampling},
author = {Minseok Seo and Mark Hamilton and Changick Kim},
journal= {arXiv preprint arXiv:2511.16301},
year = {2025}
}
备注
15 pages, 12 figures