中文

所有损失函数生而平等吗:一个神经崩塌视角

机器学习 2022-10-11 v2 人工智能 信息论 math.IT 最优化与控制 机器学习

摘要

虽然交叉熵(CE)是训练深度神经网络进行分类任务最常用的损失,但许多替代损失已被开发以获得更好的经验性能。其中哪一个最好使用仍是一个谜,因为似乎有多个因素影响答案,例如数据集属性、网络架构选择等等。本文通过考察深度网络最后一层特征来研究损失函数的选择,灵感来自近期一系列工作表明CE和均方误差(MSE)损失的全局最优解展现出神经崩塌现象。即,对于训练至收敛的足够大网络,(i)同一类的所有特征崩塌至相应类均值,且(ii)不同类关联的均值处于这样一种配置:其两两距离均相等且最大化。我们扩展了此类结果,并通过全局解与景观分析表明包括常用标签平滑(LS)和焦点损失(FL)在内的广泛损失函数族展现神经崩塌。因此,所有相关损失(即CE、LS、FL、MSE)在训练数据上产生等价特征。基于无约束特征模型假设,我们给出了LS损失的全局景观分析或FL损失的局部景观分析,并展示(唯一的!)全局极小值是神经崩塌解,而所有其他临界点是严格鞍点,其Hessian在LS损失的全局范围或FL损失在最优解附近的局部范围展现负曲率方向。实验进一步表明,只要网络足够大且训练至收敛,所有相关损失获得的神经崩塌特征在测试数据上也导致大体相同的性能。

关键词

引用

@article{arxiv.2210.02192,
  title  = {Are All Losses Created Equal: A Neural Collapse Perspective},
  author = {Jinxin Zhou and Chong You and Xiao Li and Kangning Liu and Sheng Liu and Qing Qu and Zhihui Zhu},
  journal= {arXiv preprint arXiv:2210.02192},
  year   = {2022}
}

备注

32 page, 10 figures, NeurIPS 2022