中文

神经坍缩的无约束层剥离视角

机器学习 2022-04-26 v2 机器学习

摘要

神经坍缩是神经网络在训练末期出现的一种高度对称的几何模式,对训练网络的泛化性能与鲁棒性有深远影响。为理解最后一层特征与分类器如何展现这一近期发现的隐式偏置,本文引入称为无约束层剥离模型(ULPM)的代理模型。我们证明该模型上的梯度流收敛到最小范数分离问题的临界点,其全局极小元展现神经坍缩。此外,我们证明采用交叉熵损失的ULPM其损失函数具有良性的全局景观,从而可证明除展现神经坍缩现象的全局极小元外,所有临界点均为严格鞍点。在实验上,我们展示当不使用显式正则化或权重衰减时,真实任务中神经网络的训练过程也同样符合我们的结论。

关键词

引用

@article{arxiv.2110.02796,
  title  = {An Unconstrained Layer-Peeled Perspective on Neural Collapse},
  author = {Wenlong Ji and Yiping Lu and Yiliang Zhang and Zhun Deng and Weijie J. Su},
  journal= {arXiv preprint arXiv:2110.02796},
  year   = {2022}
}

备注

Published as a conference paper at ICLR 2022