将联合嵌入预测架构与对比自监督学习相连接
计算机视觉与模式识别
2024-10-28 v1 人工智能
机器学习
图像与视频处理
信号处理
摘要
在无监督视觉表征学习的最新进展中,联合嵌入预测架构(JEPA)作为一种重要方法,通过创新的掩码策略从无标签图像中提取视觉特征而崭露头角。尽管取得了成功,但已发现其存在两个主要局限性:I-JEPA 中的指数移动平均(EMA)在防止完全坍塌方面无效,以及 I-JEPA 预测在准确学习 patch 表征均值方面的不足。针对这些挑战,本研究引入了一个新框架,即 C-JEPA(Contrastive-JEPA),它将基于图像的联合嵌入预测架构与方差-不变性-协方差正则化(VICReg)策略相结合。这种结合旨在有效学习方差/协方差以防止完全坍塌,并确保增强视图均值的恒定性,从而克服了已发现的局限性。通过实证和理论评估,我们的工作表明 C-JEPA 显著提升了视觉表征学习的稳定性与质量。在 ImageNet-1K 数据集上进行预训练时,C-JEPA 在线性探测和微调性能指标中均展现出快速且改善的收敛性。
引用
@article{arxiv.2410.19560,
title = {Connecting Joint-Embedding Predictive Architecture with Contrastive Self-supervised Learning},
author = {Shentong Mo and Shengbang Tong},
journal= {arXiv preprint arXiv:2410.19560},
year = {2024}
}