中文

视觉 Transformer 中的块循环动力学

计算机视觉与模式识别 2026-03-18 v6 人工智能 机器学习

摘要

随着视觉 Transformer (ViT) 成为标准视觉骨干网络,理解其计算现象学的机械解释至关重要。尽管存在暗示其计算结构的建构性线索,但尚无框架将 Transformer 深度解释为良好特征化的流。本工作中,我们提出块循环假说 (BRH),认为训练得到的 ViT 允许块循环深度结构,以至于原始的 LL 个块的计算可以准确地重写为仅使用 kLk \ll L 个不同块循环应用。在多样化的 ViT 上,层间表征相似性矩阵表明存在少数连续相。为确定这些相是否反映出真正可重用的计算,我们训练了预训练 ViT 的块循环近似值:Phase-structured TransfORmers 的循环近似 (Raptor)。在小规模实验中,我们展示随机深度和训练促进块循环结构,随后与我们准确拟合 Raptor 的能力相关。我们随后通过仅用 2 个块在等效运行时间下训练 Raptor 模型来恢复 DINOv2 ImageNet-1k 线性探针准确率的 96% 来提供 BRH 的经验存在证明。最后,我们利用我们的假设开发了动力学可解释性计划。我们发现:i) 在小扰动下方向性收敛到与类别相关的角度困境,具有自我纠正轨迹,ii) 标记特定动力学,其中 cls 执行尖锐的晚期重新定向,而 patch 标记表现出强烈的晚期阶段相对于其平均方向的一致性,iii) 在晚期深度中趋于低秩更新,与收敛到低维吸引子相一致。总体而言,我们发现沿 ViT 深度的紧凑块循环程序浮现,指向一种低复杂度的规范解决方案,使这些模型能够通过原则化的动力学系统分析来研究。

关键词

引用

@article{arxiv.2512.19941,
  title  = {Block-Recurrent Dynamics in Vision Transformers},
  author = {Mozes Jacobs and Thomas Fel and Richard Hakim and Alessandra Brondetta and Demba Ba and T. Andy Keller},
  journal= {arXiv preprint arXiv:2512.19941},
  year   = {2026}
}

备注

25 pages, 15 figures