两层 ReLU 网络的分析式训练
机器学习
2024-10-15 v1 机器学习
摘要
神经网络通常使用随机梯度下降或 Adam 优化器等基于梯度下降的优化算法的不同变体进行训练。近期的理论工作指出,具有平方损失的两层 ReLU 网络的临界点(损失梯度为零的点)并不全是局部极小值。然而,在这项工作中,我们将探索一种用于训练具有类 ReLU 激活和平方损失的两层神经网络的算法,该算法在保持另一层与神经元激活模式固定的同时,解析地求出损失函数关于一层的临界点。实验表明,这种简单算法能够找到比随机梯度下降或 Adam 优化器更深的极小值,在所评估的五个真实数据集中的四个上获得了显著更小的训练损失值。此外,该方法比梯度下降方法更快,并且几乎无需调参。
引用
@article{arxiv.2304.02972,
title = {Training a Two Layer ReLU Network Analytically},
author = {Adrian Barbu},
journal= {arXiv preprint arXiv:2304.02972},
year = {2024}
}
备注
17 pages, 11 figures