中文

LayerLock:基于渐进式冻结的无坍缩表示学习

计算机视觉与模式识别 2025-10-01 v3

摘要

我们引入了 LayerLock,一种用于自监督视觉表示学习的简单而有效的方法,该方法通过渐进式层冻结,逐渐从像素预测过渡到潜变量预测。首先,我们观察到在训练视频掩码自编码器(MAE)模型期间,ViT 层按其深度的顺序收敛:浅层较早收敛,深层较晚收敛。然后我们表明,可以利用这一观察结果,在整个训练过程中根据明确的计划渐进式冻结模型,从而加速标准 MAE。此外,同样的计划可用于一种简单且可扩展的潜变量预测方法中,且不会遭受“表示坍缩”。我们将提出的方法 LayerLock 应用于高达 4B 参数的大型模型,在 4DS 感知套件上的结果超越了非潜变量掩码预测的结果。

关键词

引用

@article{arxiv.2509.10156,
  title  = {LayerLock: Non-collapsing Representation Learning with Progressive Freezing},
  author = {Goker Erdogan and Nikhil Parthasarathy and Catalin Ionescu and Drew A. Hudson and Alexander Lerchner and Andrew Zisserman and Mehdi S. M. Sajjadi and Joao Carreira},
  journal= {arXiv preprint arXiv:2509.10156},
  year   = {2025}
}

备注

ICCV 2025