通过高斯混合模型理解自监督学习
机器学习
2026-01-30 v3
摘要
自监督学习试图从未标记的数据中学习表示;它通过一个损失函数来实现,该损失函数鼓励一个点的嵌入与其增广的嵌入接近。这个简单的想法表现得非常出色,但理论上尚不完全清楚其原因。在本文中,我们在一个自然背景下分析自监督学习:高斯混合模型中的降维。关键地,我们将一个数据点的增广定义为来自同一底层混合分量的另一个独立抽取。我们表明,即使在高斯分布不是各向同性的情况下——这是普通谱技术无法做到的——普通对比学习(具体来说,InfoNCE损失)也能够找到最优的低维子空间。我们还证明了“非对比”自监督学习(即SimSiam损失)的类似结果。我们进一步将分析扩展到多模态对比学习算法(例如CLIP)。在这种设置下,我们表明对比学习学习了Fisher最优子空间的子集,有效地从学习到的表示中过滤掉了所有噪声。最后,我们通过合成数据实验证实了我们的理论发现。
引用
@article{arxiv.2411.03517,
title = {Understanding Self-Supervised Learning via Gaussian Mixture Models},
author = {Parikshit Bansal and Ali Kavis and Sujay Sanghavi},
journal= {arXiv preprint arXiv:2411.03517},
year = {2026}
}