中文

深度学习训练终末阶段中神经崩塌的普遍性

机器学习 2020-09-23 v2 计算机视觉与模式识别 机器学习

摘要

现代训练分类深度网络的做法涉及训练的终末阶段(TPT),其始于训练误差首次消失的轮次;在 TPT 期间,训练误差保持有效为零,同时训练损失被推向零。对三种典型深度网络架构和七个经典分类数据集的 TPT 直接测量,揭示了一种普遍的归纳偏置,我们称之为神经崩塌(Neural Collapse),涉及四个深度互联的现象:(NC1) 最后一层训练激活的跨样本类内变异性崩塌为零,因为各个激活本身崩塌到其类均值;(NC2) 类均值崩塌到单纯形等角紧框架(Simplex Equiangular Tight Frame, ETF)的顶点;(NC3) 除去缩放,最后一层分类器崩塌到类均值,换言之崩塌到单纯形 ETF,即自对偶构型;(NC4) 对于给定的激活,分类器的决策崩塌为简单地选择具有最近训练类均值的类,即最近类中心(NCC)决策规则。由 TPT 诱导的对称且非常简单的几何结构带来了重要益处,包括更好的泛化性能、更好的鲁棒性和更好的可解释性。

关键词

引用

@article{arxiv.2008.08186,
  title  = {Prevalence of Neural Collapse during the terminal phase of deep learning training},
  author = {Vardan Papyan and X. Y. Han and David L. Donoho},
  journal= {arXiv preprint arXiv:2008.08186},
  year   = {2020}
}