中文

基于块级自监督学习的视频视觉 Transformer 深度表征开发

计算机视觉与模式识别 2026-01-15 v1

摘要

端到端反向传播通过全局误差信号将所有层耦合,实现协调学习,但需要长程信任分配。受最近进展的启发,我们询问是否可以无需端到端反向传播来训练掩码视频 Transformer。将块级自监督学习应用于掩码视频建模仍相对不够探索,且必须处理时空上下文和长程时序结构。更广泛地,分析比较块级学习和端到端训练在学习动力学和深度表征开发方面的差异仍稀少。我们将块级学习应用于掩码自编码视频视觉 Transformer,通过将编码器划分为多个块,每个块都用局部掩码重建损失进行优化。跨模型规模和分区粒度,训练收敛,产生的表征接近匹配的端到端基准(在线性探测和检索代理下)。为了比较中间表征,我们分析深度可解性、块间相似性和 patch 级别诊断。块级训练更早暴露高层结构,而后续块饱和并以更几何保序的模式运行。它还可诱导与更强早期混合一致的标记级偏移,这些偏移可能被池化指标遗漏。这些发现指向后续块饱和和界面形成是导致剩余差距的贡献者。

关键词

引用

@article{arxiv.2601.09040,
  title  = {Depth-Wise Representation Development Under Blockwise Self-Supervised Learning for Video Vision Transformers},
  author = {Jonas Römer and Timo Dickscheid},
  journal= {arXiv preprint arXiv:2601.09040},
  year   = {2026}
}