中文

联合嵌入与重建:自监督学习中潜在空间预测的可证明优势

机器学习 2025-10-15 v2 人工智能 计算机视觉与模式识别

摘要

重建和联合嵌入已成为自监督学习 (SSL) 中的两种领先范式。重建方法侧重于从输入空间的不同视图中恢复原始样本。另一方面,联合嵌入方法在潜在空间中对不同视图的表示进行对齐。这两种方法各自提供了引人注目的优势,但实践者缺乏在两者之间作出明确选择的指导方针。本 work 揭示了区分每个范式的核心机制。通过利用两种方法的闭形式解,我们精确地描述了视图生成过程(例如数据增强)如何影响所学表示。随后,我们表明,与监督学习不同,两种 SSL 范式在样本数不断增大时,需要最低限度的 augmentations 与无关特征的对齐才能实现渐近最优性。我们的发现表明,在这些无关特征具有较大幅度的情境下,联合嵌入方法更为可取,因为它们施加的对齐条件严格 weaker than 基于重建的方法。这一结果不仅阐明了两种范式之间的权衡,还证实了在真实世界具有挑战性的数据集上联合嵌入方法的经验成功。

关键词

引用

@article{arxiv.2505.12477,
  title  = {Joint Embedding vs Reconstruction: Provable Benefits of Latent Space Prediction for Self Supervised Learning},
  author = {Hugues Van Assel and Mark Ibrahim and Tommaso Biancalani and Aviv Regev and Randall Balestriero},
  journal= {arXiv preprint arXiv:2505.12477},
  year   = {2025}
}

备注

33 pages, 9 figures