中文

关于监督学习与自监督对比学习对齐性的研究

机器学习 2025-10-13 v1

摘要

自监督对比学习(CL)取得了显著的经验成功,常常在下游任务上产生与监督预训练相似的表征。最近的理论解释表明,CL损失与负样本仅监督对比学习(NSCL)损失在类别数量增大时接近。然而,这种损失层面的相似性仍留下了一个开放问题:CL与NSCL在训练过程中是否也保持在表征层面上的对齐性,仅仅是在目标层面上呢?我们通过分析在共享随机性(相同初始化、批次和数据增强)下训练的CL和NSCL模型的表征对齐性来回答此问题。首先,我们证明了它们产生的表征保持相似性:具体而言,我们证明了在现实条件下,CL和NSCL的相似矩阵彼此接近。我们的界限提供了关于对齐指标如中心化核对齐(CKA)和表征相似性分析(RSA)的高概率保证,并阐明了随着类别数量增加、温度提高以及批次大小影响,对齐如何改善。相比之下,我们演示了参数空间的耦合是本质不稳定的:CL与NSCL权重之间的差异可随训练时间呈指数增长。最后,我们在实验中验证了这些预测,表明CL-NSCL对齐随规模和温度而增强,NSCL比其他监督目标更贴近CL。这将NSCL置于自监督学习与监督学习之间的原则性桥梁。我们的代码和项目页面均可在[此处访问]。

关键词

引用

@article{arxiv.2510.08852,
  title  = {On the Alignment Between Supervised and Self-Supervised Contrastive Learning},
  author = {Achleshwar Luthra and Priyadarsi Mishra and Tomer Galanti},
  journal= {arXiv preprint arXiv:2510.08852},
  year   = {2025}
}