中文

UniRefiner:通过对比寄存器教预训练的 ViT 自主处理杂质

计算机视觉与模式识别 2026-05-20 v1

摘要

视觉变换器 (ViT) 的表示学习取得了快速进展,但大规模模型在空间敏感任务中的实用性受到虚假 token 的阻碍。先前的努力有限,往往将这些瑕疵狭义定义,例如仅视为简单的高范数离群值。我们认为,这一范围不足够。对于密集预测任务,我们认为,任何未能编码位置一致语义的 token 都应被视为虚假瑕疵。这种更广泛的定义揭示了更复杂的问题,导致我们系统性地对三类基本类型的虚假 token 进行分类和特征化。基于这一全面诊断,我们提出了 UniRefiner,一个通用的细化框架,教导预训练的 ViT 自主处理这些瑕疵。UniRefiner 使用对比寄存器显式地隔离和重新分配虚假 token,通过双目标实现:(i) 将图像 token 与过滤后的常规 token 对齐以保留语义,(ii) 将寄存器 token 与检测到的虚假 token 对齐以捕获虚假信号。该方法仅需针对约 5k 张图像进行几轮微调,即可细化包括 EVA-CLIP-8B 和 InternViT-6B 等多种大型 ViT。实验表明,经细化的 EVA-CLIP-8B 在 ADE20K 上实现 51.9% mIoU(提升 9.4%),超越专门的视觉模型如 DINOv2(49.1%),而零样本分割精度提升幅度可达 22%。UniRefiner 解锁了现有大规模基础模型的潜在空间潜力,为其更广泛的应用指明了道路。

关键词

引用

@article{arxiv.2605.19622,
  title  = {UniRefiner: Teaching Pre-trained ViTs to Self-Dispose Dross via Contrastive Register},
  author = {Congpei Qiu and Zhaoyu Hu and Wei Ke and Zhuotao Tian and Yanhao Wu and Tong Zhang},
  journal= {arXiv preprint arXiv:2605.19622},
  year   = {2026}
}

备注

CVPR 2026