InfoNCE诱导高斯分布
机器学习
2026-03-02 v1 信号处理
摘要
对比学习已成为现代表征学习的基石,使其能够使用大量无标签数据进行训练,适用于特定任务和通用(基础)模型。对比训练中原型损失是InfoNCE及其变体。在本工作中,我们展示InfoNCE目标在从对比训练中产生的表征中引导高斯结构。我们在两个互补的 regimes 中建立了这一结果。首先,我们在 Certain alignment and concentration 假设下,表明高维表征的投影在渐近意义上趋近于多元高斯分布。其次,在较宽松的假设下,我们表明添加一个小的渐近消失的正则化项,可促进低特征范数和高特征熵,导致类似的渐近结果。我们通过在合成数据集和CIFAR-10数据集上进行实验,测试多个编码器架构和大小,证明了一致的高斯行为。这一视角提供了对对比表征中常见高斯性的原则性解释。 resulting Gaussian model enables principled analytical treatment of learned representations and is expected to support a wide range of applications in contrastive learning.
引用
@article{arxiv.2602.24012,
title = {InfoNCE Induces Gaussian Distribution},
author = {Roy Betser and Eyal Gofer and Meir Yossef Levi and Guy Gilboa},
journal= {arXiv preprint arXiv:2602.24012},
year = {2026}
}
备注
Accepted to ICLR 2026, Oral