中文

剖析监督对比学习

机器学习 2023-03-03 v4 机器学习

摘要

在监督学习任务上训练神经网络时,对由高容量编码器复合的线性映射的 softmax 分数最小化交叉熵可以说是最流行的选择。然而,近期工作表明,可以直接优化编码器,通过对比目标的监督变体获得同等(甚至更具)判别性的表示。在本工作中,我们探讨一个问题:在最小损失下,编码器输出空间中所求表示几何是否存在根本差异。具体而言,我们在温和假设下证明,一旦每类的表示坍缩为正则单形的顶点(内接于超球面),两种损失均达到其最小值。我们提供经验证据,表明该构型在实践中有达到,且抵达接近最优状态通常意味着良好的泛化性能。然而,两种损失展现出显著不同的优化行为。对于监督对比损失,完美拟合数据所需的迭代次数随随机翻转标签的数量超线性增长。这与先前报道的以交叉熵训练的网络近似线性增长形成对比。

关键词

引用

@article{arxiv.2102.08817,
  title  = {Dissecting Supervised Contrastive Learning},
  author = {Florian Graf and Christoph D. Hofer and Marc Niethammer and Roland Kwitt},
  journal= {arXiv preprint arXiv:2102.08817},
  year   = {2023}
}

备注

v4 updates: - updated appendix section S1.3 - this includes fixing an oversight in the proofs (Lemma 1 missed an equality condition, which now appears in Lemma 2) - improved figure quality