MSE损失下的神经崩塌:对中心路径的逼近及其上的动力学
摘要
近来发现的神经崩塌(Neural Collapse, NC)现象在当今将交叉熵(cross-entropy, CE)损失驱动至零的深度网络训练范式中普遍存在。在NC期间,最后一层特征崩塌至其类均值,分类器与类均值均崩塌至同一单纯形等角紧框架(Simplex Equiangular Tight Frame),且分类器行为崩塌至最近类均值决策规则。近期工作表明,使用均方误差(mean squared error, MSE)损失训练的深层网络性能与CE训练的相当。作为初步,我们通过三个典型网络和五个基准数据集上的实验,经验性地确立了NC同样出现在此类MSE训练的深度网络中。我们在一个Google Colab笔记本中提供了用于复现MSE-NC与CE-NC的PyTorch代码:https://colab.research.google.com/github/neuralcollapse/neuralcollapse/blob/main/neuralcollapse.ipynb。相较于难以分析的CE损失,解析上易处理的MSE损失提供了更多数学机会,促使我们利用MSE损失对NC进行理论研究。我们做出三项主要贡献:(I)我们给出了MSE损失的一种新分解,分为(A)可直接通过NC视角解释、且假设最后一层分类器恰为最小二乘分类器的项;以及(B)刻画偏离该最小二乘分类器程度的项。(II)我们在典型数据集与网络上展示实验,表明项(B)在训练过程中可忽略。这促使我们引入一个新的理论构造:中心路径(central path),其中线性分类器在特征激活的整个动力学过程中保持MSE最优。(III)通过研究沿中心路径的重归一化梯度流,我们推导出了预测NC的精确动力学。
引用
@article{arxiv.2106.02073,
title = {Neural Collapse Under MSE Loss: Proximity to and Dynamics on the Central Path},
author = {X. Y. Han and Vardan Papyan and David L. Donoho},
journal= {arXiv preprint arXiv:2106.02073},
year = {2022}
}
备注
ICLR 2022 Outstanding Paper Prize & Oral. Appendix contains [A] empirical experiments, [B-D] proofs of theoretical results, and [E] survey of related works examining Neural Collapse