中文

层层递进、模块递进:为选择最优 OOD probing 而服务于 ViT

计算机视觉与模式识别 2026-03-06 v1 机器学习 机器学习

摘要

近期研究发现,基础模型的中间层往往比最终层更具判别性。虽然最初归因于自回归预训练,但这种现象也出现在通过监督和判别式自监督目标训练的模型中。本文对预训练视觉变换器的中间层行为进行全面研究。通过在多样化的图像分类基准上进行大规模线性探针实验,我们发现预训练和下游数据之间的分布迁移是深层次性能衰减的主要原因。此外,我们在模块层面进行了细粒度分析。我们的发现表明,对变换器块输出的标准探针是次优的;相反,在分布迁移显著时,探针 feedforward network 中的激活效果最佳,而在分布迁移较弱时,探针多头自注意力模块的归一化输出效果最佳。

关键词

引用

@article{arxiv.2603.05280,
  title  = {Layer by layer, module by module: Choose both for optimal OOD probing of ViT},
  author = {Ambroise Odonnat and Vasilii Feofanov and Laetitia Chapel and Romain Tavenard and Ievgen Redko},
  journal= {arXiv preprint arXiv:2603.05280},
  year   = {2026}
}

备注

Accepted at ICLR 2026 CAO Workshop