JAFAR:在任意分辨率下提升任意特征
计算机视觉与模式识别
2026-01-29 v3 图像与视频处理
摘要
基础视觉编码器已成为各种密集视觉任务不可或缺的工具。然而,其低分辨率的空间特征输出需要进行特征上采样,以产生下游任务所需的高分辨率模态。在本工作中,我们引入了 JAFAR,这是一种轻量且灵活的特征上采样器,可将来自任意基础视觉编码器的视觉特征的空间分辨率增强至任意目标分辨率。JAFAR 采用了一个基于注意力的模块,利用空间特征变换(SFT)调制,促进源自低级图像特征的高分辨率查询与语义增强的低分辨率键之间的语义对齐。值得注意的是,尽管缺乏高分辨率监督,我们证明了在低上采样比率和低分辨率下的学习能够出色地泛化到显著更高的输出尺度。大量实验表明,JAFAR 能有效恢复细粒度的空间细节,并在多种下游任务中始终优于现有的特征上采样方法。项目页面位于 https://jafar-upsampler.github.io
引用
@article{arxiv.2506.11136,
title = {JAFAR: Jack up Any Feature at Any Resolution},
author = {Paul Couairon and Loick Chambon and Louis Serrano and Jean-Emmanuel Haugeard and Matthieu Cord and Nicolas Thome},
journal= {arXiv preprint arXiv:2506.11136},
year = {2026}
}
备注
Code available at https://github.com/PaulCouairon/JAFAR