中文

增强空间条件下的 JEPAs:稳健与高效的表征学习

机器学习 2024-10-15 v1 计算机视觉与模式识别

摘要

基于图像的联合嵌入预测架构 (IJEPA) 为使用掩码图像建模框架进行表征学习提供了引人注目的替代方案。IJEPA 通过在潜空间而非输入空间进行预测,驱动表征捕获有用的语义信息。然而,IJEPA 依赖于精心设计的上下文窗口和目标窗口以避免表征坍缩。IJEPA 中的编码器模块无法根据掩码预测任务的可行性来自适应调制预测和/或目标特征的类型,因为它们没有足够的信息了解上下文和目标。基于自然图像中信息具有强大空间偏见——即空间局部区域相对于远距离区域具有高度预测性——我们对 IJEPA 的目标编码器和上下文编码器模块施加位置信息。我们的"受控"编码器在多个图像分类基准数据集上实现性能提升,提高了对上下文窗口大小的鲁棒性以及预训练过程中的样本效率。

关键词

引用

@article{arxiv.2410.10773,
  title  = {Enhancing JEPAs with Spatial Conditioning: Robust and Efficient Representation Learning},
  author = {Etai Littwin and Vimal Thilak and Anand Gopalakrishnan},
  journal= {arXiv preprint arXiv:2410.10773},
  year   = {2024}
}

备注

NeurIPS 2024 Workshop on Self-Supervised Learning - Theory and Practice. Comments welcome!