通过层剥离模型探索深度神经网络:不平衡训练中的少数类坍缩
机器学习
2022-05-11 v3 计算机视觉与模式识别
最优化与控制
机器学习
摘要
本文中,我们引入\textit{层剥离模型}(Layer-Peeled Model)——一个非凸但解析上可处理的优化程序,以更好地理解被训练足够长时间的深度神经网络。顾名思义,该新模型通过从神经网络其余部分中隔离最顶层得到,随后对网络两部分分别施加特定约束。我们证明,层剥离模型虽简单,却继承了训练良好神经网络的诸多特性,从而提供了一个解释和预测深度学习训练常见经验模式的有效工具。首先,在处理类平衡数据集时,我们证明该模型的任一解均形成单纯形等角紧框架,这在一定程度上解释了最近发现的神经坍缩现象\cite{papyan2020prevalence}。更重要的是,当转向不平衡情形时,我们对层剥离模型的分析揭示了一个此前未知的现象,我们称之为\textit{少数类坍缩}(Minority Collapse),它从根本上限制了深度学习模型在少数类上的性能。此外,我们利用层剥离模型深入认识如何缓解少数类坍缩。有趣的是,该现象先由层剥离模型预测,而后才被我们的计算实验所证实。
引用
@article{arxiv.2101.12699,
title = {Exploring Deep Neural Networks via Layer-Peeled Model: Minority Collapse in Imbalanced Training},
author = {Cong Fang and Hangfeng He and Qi Long and Weijie J. Su},
journal= {arXiv preprint arXiv:2101.12699},
year = {2022}
}
备注
Accepted at Proceedings of the National Academy of Sciences (PNAS); Changed the title