中文

用于探究深度神经崩溃的扩展无约束特征模型

机器学习 2022-10-13 v3

摘要

现代训练深度神经网络用于分类任务的策略包括:即便训练误差消失后,仍继续优化网络权重,以进一步将训练损失推向零。近来,在此训练过程中被经验性地观察到一种称为“神经崩溃”(NC)的现象。具体而言,已表明类内样本的学习特征(倒数第二层的输出)会收敛至其均值,且不同类的均值呈现出某种紧框架结构,该结构并与最后一层的权重对齐。近期论文表明,当以正则化交叉熵损失优化简化的“无约束特征模型”(UFM)时,具有此结构的最小化解会出现。本文中,我们进一步分析并扩展 UFM。首先,我们研究正则化 MSE 损失下的 UFM,并表明最小化解的特征可比交叉熵情形具有更精细的结构,这也影响了权重的结构。接着,我们通过向模型添加另一层权重及 ReLU 非线性来扩展 UFM,并推广了我们先前的结果。最后,我们通过实验证明了我们所提非线性扩展 UFM 在建模实际网络中出现的 NC 现象方面的有用性。

关键词

引用

@article{arxiv.2202.08087,
  title  = {Extended Unconstrained Features Model for Exploring Deep Neural Collapse},
  author = {Tom Tirer and Joan Bruna},
  journal= {arXiv preprint arXiv:2202.08087},
  year   = {2022}
}

备注

ICML 2022. Relaxed Theorem 4.2 and clarified proofs