我的神经网络收敛到哪个极小解?
机器学习
2023-09-26 v2 机器学习
摘要
过参数化神经网络(NN)的损失面拥有许多零训练误差的全局极小解。我们解释标准 NN 训练过程的常见变体如何改变所获得的极小解。首先,我们明确说明强过参数化 NN 的初始化大小如何影响极小解并损害其最终测试性能。我们提出一种限制该影响的策略。接着,我们证明对于 AdaGrad 等自适应优化,所获得的极小解通常不同于梯度下降(GD)极小解。该自适应极小解被随机小批量训练进一步改变,尽管在非自适应情形下 GD 与随机 GD 导致本质相同的极小解。最后,我们说明这些影响对较少过参数化的 NN 仍然相关。尽管过参数化有其益处,我们的工作强调它引入了在欠参数化模型中不存在的误差来源。
引用
@article{arxiv.2011.02408,
title = {Which Minimizer Does My Neural Network Converge To?},
author = {Manuel Nonnenmacher and David Reeb and Ingo Steinwart},
journal= {arXiv preprint arXiv:2011.02408},
year = {2023}
}