中文

重审 JEPA:基于冻结教师的计算高效视频自监督学习

机器学习 2025-09-30 v1 计算机视觉与模式识别

摘要

Video Joint Embedding Predictive Architectures(V-JEPA)通过预测经指数移动平均(EMA)更新的教师在潜在空间中掩码区域来学习通用且可即取的视频表征。虽然 EMA 可防止表征坍缩,但其复杂化了可扩展的模型选择,并将教师和学生体系结构耦合在一起。我们重新审视掩码潜在预测,发现冻结教师即可。具体而言,我们(i)以简单的像素重构目标训练目标编码器,然后(ii)冻结其并训练学生预测教师在掩码区域的潜在表示。这导致一种两阶段、无正则化的方案,我们称之为 SALT(Static-teacher Asymmetric Latent Training)。SALT 将优化解耦为像素重构(教师)和掩码潜在预测(学生),增加了透明度、效率和可扩展性,同时保持表征在冻结评估下的泛化能力。经验上,我们的学生模型在多样化基准测试中优于最近提出的 V-JEPA 2 编码器。它们也更计算高效:在匹配的预训练 FLOPs 下,我们的方法实现更高的探测准确率,其规模曲线主导 V-JEPA 的准确率-FLOPs Pareto 前沿。最后,我们发现学生质量对教师质量异常稳健:即使教师较小、次优,仍可诱导高质量学生。这指向应优先分配给学生的计算预算。这些结果将 SALT 定位为 EMA 基于自教学习视频表征学习的简单、可扩展且计算高效替代方案。

关键词

引用

@article{arxiv.2509.24317,
  title  = {Rethinking JEPA: Compute-Efficient Video SSL with Frozen Teachers},
  author = {Xianhang Li and Chen Huang and Chun-Liang Li and Eran Malach and Josh Susskind and Vimal Thilak and Etai Littwin},
  journal= {arXiv preprint arXiv:2509.24317},
  year   = {2025}
}

备注

Technical Report