加权逆卷积用于特征上采样
计算机视觉与模式识别
2026-05-21 v2
摘要
预训练视觉基础模型 (VFM) 提供了强大的语义表示,但其基于块的特征本质上较粗糙,限制了其在需要精细局部定位、稠密预测和点级对应关系的任务中的有效性。本文从 \textbf{\textit{逆问题}的角度重新审视特征上采样,提出一种加权逆卷积 (WRC),用于稠密化高层视觉描述符的空间自适应逆算子。具体而言,我们将特征上采样形式化为一个加权 Tikhonov 正则化最小二乘问题,其中空间变动权重在每个空间位置调制数据保真度和先验强度。这使得 WRC 能够适应空间变动的特征特性,从而在保持关键结构的同时缓解过平滑问题。此外,WRC 保留了一个高效、全可微的闭式 FFT 求解方案,使其成为一种实用的即插即用上采样算子。集成到一个轻量级的自监督稠密化框架中后,WRC 在各种下游基准测试上 consistently 提升了稠密特征质量,包括分割、深度估计、视频对象分割、对象发现和关键点对应,同时保持了高的计算效率。
关键词
引用
@article{arxiv.2605.17472,
title = {Weighted Reverse Convolution for Feature Upsampling},
author = {Wentong Li and Zhiyuan Qi and Zichen Zhao and Kai Zhang and Lei Zhang},
journal= {arXiv preprint arXiv:2605.17472},
year = {2026}
}
备注
18 pages, 7 figures, code:https://github.com/PolyU-VCLab/WRC