中文

从边缘到深度:探究视觉变换器中的空间层级

计算机视觉与模式识别 2026-04-28 v1 机器学习

摘要

仅在图像分类上进行训练的视觉变换器(ViT)定期能够迁移到需要空间理解的任务,尽管在预训练过程中未接收到任何空间监督。我们询问这些结构编码的稳健位置和方式。通过对冻结的 ViT-B/16 层级进行探测,针对两种互补属性进行检验:局部 patch 边界(BSDS500)和每个 patch 的深度(NYU Depth V2),结果显示出清晰的层级结构:边界结构在第 5-6 层即可被线性解码(AP = 0.833),而深度(需要整合全局线索)则在第 8 层达到峰值(MAE = 0.0875)。两种信号在最终分类层都坍缩了,随机权重控制确认这些编码是学习得出的而非建构的。因果干预增加了具体性:剔除线性深度探针读取的单一方向会使深度解码下降最高可达 165%,而剔除其他任何方向的影响则不足 1%。沿该方向进行的针对性激活补丁显示,深度信号在每个层级部分被重新派生,而非被动地保留在残差流中,中层干预在下游的持续性最强。结果是,一个在分类训练下的 ViT 开发出一个主动维护的空间层级,其结构反映了在灵长类动物视觉皮层中所观察到的早期到晚期的进程。

关键词

引用

@article{arxiv.2604.23452,
  title  = {From Edges to Depth: Probing the Spatial Hierarchy in Vision Transformers},
  author = {Jainum Sanghavi},
  journal= {arXiv preprint arXiv:2604.23452},
  year   = {2026}
}

备注

12 pages, 6 figures. Code available at https://github.com/JainumSanghavi/ProbingViTs