SPAR:用于开放词汇分割的单 pass 任意分辨率 ViT
计算机视觉与模式识别
2026-04-03 v1
摘要
基础 Vision Transformer(ViT)由于固定预训练分辨率及其固有的粗糙 patch 级表示,在需要精细空间理解的任务中效果有限。这一挑战在密集预测场景(如基于 ViT 的视觉-语言模型的开放词汇分割)尤为突出,因为高分辨率输入对准确的像素级推理至关重要。现有方法通常在预训练分辨率下使用滑动窗口策略处理大分辨率图像。虽然通过更细的步幅提高了精度,但计算成本显著增加。我们引入 SPAR:单 pass 任意分辨率 ViT,一种为高效高分辨率推理设计的分辨率无关密集特征提取器。通过特征回归损失,将细粒度滑动窗口教师的空间推理能力蒸馏到单个 student 上,无需架构修改或像素级监督。应用于开放词汇分割,SPAR 在单 pass 基线上提升最高可达 10.5 mIoU,甚至超越教师模型,展示了在高效高分辨率推理方面的有效性。代码:https://github.com/naomikombol/SPAR
引用
@article{arxiv.2604.02252,
title = {SPAR: Single-Pass Any-Resolution ViT for Open-vocabulary Segmentation},
author = {Naomi Kombol and Ivan Martinović and Siniša Šegvić and Giorgos Tolias},
journal= {arXiv preprint arXiv:2604.02252},
year = {2026}
}
备注
Accepted to CVPR 2026