从对齐到预测:自监督学习与预测表示学习研究
机器学习
2026-04-16 v1 人工智能
摘要
自监督学习已成为从无标签数据中学习的主要技术,当前的方法大多围绕表示与输入重构的对齐展开。尽管此类方法在实际应用中表现优异,但其应用范围主要局限于从观测数据中学习,难以提供一种能预测数据分布的学习结构。本文研究了自监督学习领域的一些最新发展。我们定义了一种新类别,称为预测表示学习 (PRL),其围绕基于观测预测数据未观测组件的潜在表示展开。我们提出了一种通用分类法,将 PRL 与对齐和重构基于的学习方法进行归类。进一步地,我们认为联合嵌入预测架构 (Joint-Embedding Predictive Architecture, JEPA) 可被视为这一新范式的典型代表。我们进一步讨论了理论视角和开放挑战,突出预测表示学习作为未来自监督学习研究的有前景的方向。在本研究中,我们实现了 Bootstrap Your Own Latent (BYOL)、Masked Autoencoders (MAE) 和 Image-JEPA (I-JEPA) 以进行比较分析。结果表明,MAE 实现完美的相似度 1.00,但其鲁棒性相对较弱为 0.55;相比之下,BYOL 和 I-JEPA 分别获得准确率为 0.98 和 0.95,鲁棒性得分为 0.75 和 0.78。
引用
@article{arxiv.2604.13518,
title = {From Alignment to Prediction: A Study of Self-Supervised Learning and Predictive Representation Learning},
author = {Mintu Dutta and Ritesh Vyas and Mohendra Roy},
journal= {arXiv preprint arXiv:2604.13518},
year = {2026}
}
备注
This article has been submitted to the 2026 International Conference on Applied Artificial Intelligence (2AI), Central University of Kashmir, India