中文

基于信息瓶颈方法理解监督对比学习中的神经崩溃现象

机器学习 2024-06-28 v2 信息论 math.IT

摘要

神经崩溃描述了深度神经网络在训练超过性能平台期后其最后一层激活值的几何结构。开放性问题包括神经崩溃是否带来更好的泛化能力,若是,为何以及超过平台期的训练如何起作用。我们将神经崩溃建模为一个信息瓶颈(IB)问题,以探究这种紧凑表示是否存在并发现其与泛化的联系。我们证明,神经崩溃当且仅当逼近分类问题的最优 IB 解时才会带来良好的泛化。近期研究表明,两个以相同对比损失目标独立训练的深度神经网络是线性可辨识的,即所得表示在矩阵变换下等价。我们利用线性可辨识性来近似 IB 问题的解析解。该近似表明,当类均值表现出 KK-单纯形等角紧框架(ETF)行为时(例如 CIFAR10 中 KK=10,CIFAR100 中 KK=100),它们与相应 IB 问题的临界相变一致。一旦 IB 问题的最优解包含所有这些相变,性能平台期便会出现。我们还展示了利用以 ResNet50 为骨干的监督对比学习,可将所得 KK-单纯形 ETF 打包进一个 KK 维高斯分布。该几何结构表明,监督对比学习学到的 KK-单纯形 ETF 逼近了用于信源编码的最优特征。因此,在对比学习中,最优 IB 解与泛化之间存在直接对应。

关键词

引用

@article{arxiv.2305.11957,
  title  = {Towards understanding neural collapse in supervised contrastive learning with the information bottleneck method},
  author = {Siwei Wang and Stephanie E Palmer},
  journal= {arXiv preprint arXiv:2305.11957},
  year   = {2024}
}