中文

面向迭代式图像尺寸无关视觉Transformer的自监督预训练

计算机视觉与模式识别 2026-04-23 v1

摘要

视觉Transformer(ViT)在自监督学习(SSL)中占据主导地位。尽管它们已被证明在大规模预训练中非常有效,但计算效率低且随图像尺寸扩展性差。因此,像 DINO 这样的基础模型被限制在低分辨率处理。最近一种受中央凹启发的Transformer通过迭代处理固定尺寸的多缩放块上下文,实现了分辨率无关性。该模型通过监督学习,利用一种顺序的、类似循环的过程且无需时间反向传播,展示了有前景的结果。为了释放其作为基础骨干网络的潜力,我们引入了一种基于 DINO 自蒸馏目标的新型顺序到全局 SSL 框架。在一种高效的积分图像块提取方法的支持下,我们的方法能够对图像尺寸无关的视觉编码器进行大规模预训练。我们在 ImageNet-1K 和下游分类任务上取得了有竞争力的性能,且无论输入分辨率如何,都保持恒定的计算预算。

关键词

引用

@article{arxiv.2604.20392,
  title  = {Self-supervised pretraining for an iterative image size agnostic vision transformer},
  author = {Nedyalko Prisadnikov and Danda Pani Paudel and Yuqian Fu and Luc Van Gool},
  journal= {arXiv preprint arXiv:2604.20392},
  year   = {2026}
}