神经网络的分层L1损失景观在局部极小值附近更为复杂
机器学习
2021-05-07 v1 机器学习
摘要
对于固定的训练数据和其他层中的网络参数,ReLU神经网络的L1损失作为第一层参数的函数是一个分段仿射函数。我们使用Deep ReLU Simplex算法在相邻顶点上迭代单调地最小化损失,并分析这些顶点位置的轨迹。我们通过实验观察到,在局部极小值的邻域内,迭代表现出不同的行为,从而可以在找到局部极小值之前对其损失水平和接近程度做出推断:首先,损失在迭代的相邻顶点上似乎以指数级缓慢衰减,因此可以根据后续迭代顶点的损失水平估计局部极小值处的损失水平;其次,我们观察到局部极小值周围的顶点密度显著增大。这可能对设计新的梯度下降算法具有深远影响,此类算法可利用这些事实来改善收敛速度。
引用
@article{arxiv.2105.02831,
title = {The layer-wise L1 Loss Landscape of Neural Nets is more complex around local minima},
author = {Peter Hinz},
journal= {arXiv preprint arXiv:2105.02831},
year = {2021}
}
备注
4 pages, 5 figures