中文

JEPA 如何避免噪声特征:深度线性自蒸馏网络的隐式偏置

机器学习 2024-07-08 v1

摘要

存在两种自监督学习数据表征的互竞范式。联合嵌入预测架构(Joint Embedding Predictive Architecture, JEPA)是一类 wherein 语义相似的输入被编码为彼此可预测的表征的架构。最近一种成功落入 JEPA 框架的方法是自蒸馏,即在线编码器被训练来预测目标编码器的输出,有时会使用轻量级预测网络。这种做法与掩码自编码器(Masked AutoEncoder, MAE)范式形成对比,后者则训练编码器和解码器来重建输入空间中缺失的部分,而非其潜在表征。使用 JEPA 方法而非 MAE 的常见动机是该 JEPA 目标优先考虑抽象特征而非细粒度像素信息(后者可能不可预测且缺乏信息性)。本文通过分析深度线性模型的训练动力学,旨在理解这种经验观察背后的机制。我们发现了一个令人惊讶的机制:在简化的线性环境中,两种方法学习类似表征,而 JEPAs 被偏向学习高影响力特征,即具有高回归系数的特征。我们的结果指向预测在潜在空间中的不同隐式偏置,可能为其实际应用中的成功提供了解释。

关键词

引用

@article{arxiv.2407.03475,
  title  = {How JEPA Avoids Noisy Features: The Implicit Bias of Deep Linear Self Distillation Networks},
  author = {Etai Littwin and Omid Saremi and Madhu Advani and Vimal Thilak and Preetum Nakkiran and Chen Huang and Joshua Susskind},
  journal= {arXiv preprint arXiv:2407.03475},
  year   = {2024}
}

备注

Technical report