中文

CNN-JEPA:使用联合嵌入预测架构的自监督预训练卷积神经网络

计算机视觉与模式识别 2025-03-12 v2

摘要

自监督学习已成为预训练大型神经网络的重要方法,实现了模型和数据集规模的空前扩展。尽管 I-JEPA 等最新进展在视觉 Transformer 上显示出有前景的结果,但将此类方法适配到卷积神经网络面临独特挑战。本文引入 CNN-JEPA,一种成功将联合嵌入预测架构方法应用于 CNN 的新型自监督学习方法。我们的方法采用稀疏 CNN 编码器处理掩码输入,使用深度可分离卷积的全卷积预测器,以及改进的掩码策略。我们证明 CNN-JEPA 在 ImageNet-100 上优于使用 ViT 架构的 I-JEPA,使用标准 ResNet-50 编码器实现了 73.3% 的线性 top-1 准确率。与其他基于 CNN 的自监督学习方法相比,CNN-JEPA 在相同 epoch 数下需要少 17-35% 的训练时间,并且接近 BYOL、SimCLR 和 VICReg 的线性和 k-NN top-1 准确率。我们的方法为现有的 CNN 自监督学习方法提供了一种更简单、更高效的替代方案,仅需最少的增强且无需单独投影器网络。

关键词

引用

@article{arxiv.2408.07514,
  title  = {CNN-JEPA: Self-Supervised Pretraining Convolutional Neural Networks Using Joint Embedding Predictive Architecture},
  author = {András Kalapos and Bálint Gyires-Tóth},
  journal= {arXiv preprint arXiv:2408.07514},
  year   = {2025}
}

备注

Preprint