中文

选择哪个方向?自监督ViT在下游任务中表征能力的分析

计算机视觉与模式识别 2025-09-22 v1

摘要

视觉Transformer(ViTs)的自监督学习(SSL)作为多种计算机视觉任务的预训练策略近期展示了显著潜力,包括在标准和少样本下游情境下的图像分类和分割。两种预训练目标主导了SSL技术的格局:对比学习和掩码图像建模。从最终Transformer注意力块中提取的特征(或token)——具体而言键、查询和值——以及最终块前馈层之后获取的特征,已成为解决下游任务的常见基础。然而,在许多现有方法中,这些预训练的ViT特征通过额外的变换层进一步处理,通常涉及轻量级头部或与蒸馏相结合,以实现更优的任务性能。虽然此类方法可以改善任务结果,但据我们所知,对未修改ViT特征内在表征能力的全面分析尚未开展。本研究旨在通过系统评估这些未修改特征在图像分类和分割任务中的应用来弥合这一差距,涵盖标准和少样本情境。我们使用的分类和分割规则要么基于超平面(如逻辑回归),要么基于余弦相似度,两者都依赖于ViT潜在空间中可解释方向的存在。基于上述规则且不使用额外特征变换,我们在token类型、任务和预训练ViT模型上进行了分析。本研究为根据任务、情境和预训练目标选择最优token类型和决策规则提供了见解,同时报告了两个广泛使用数据集上的详细发现。

关键词

引用

@article{arxiv.2509.15272,
  title  = {Which Direction to Choose? An Analysis on the Representation Power of Self-Supervised ViTs in Downstream Tasks},
  author = {Yannis Kaltampanidis and Alexandros Doumanoglou and Dimitrios Zarpalas},
  journal= {arXiv preprint arXiv:2509.15272},
  year   = {2025}
}

备注

24 pages, XAI 2025