中文

SANE:通过锐度调整有效参数量刻画梯度下降的各阶段

机器学习 2023-05-31 v1

摘要

现代神经网络无疑取得了成功。大量研究探讨了损失景观的曲率如何影响解的质量。在这项工作中,我们考虑网络训练过程中的 Hessian 矩阵。我们重申“良定”或“有效”参数数量与神经网络泛化性能之间的联系,并展示其作为模型比较工具的用途。通过考虑局部曲率,我们提出锐度调整有效参数量(SANE),一种用于解质量的有效维数度量。我们表明 SANE 对大学习率具有鲁棒性,这类学习机制颇具吸引力但(臭)名昭著地不稳定。我们提供证据并刻画大学习率下跨“损失盆地”的 Hessian 偏移。最后,将分析扩展到更深的神经网络,我们借助神经权重的自然排序给出全网络 Hessian 的近似,并利用该近似为我们的主张提供广泛的经验证据。

关键词

引用

@article{arxiv.2305.18490,
  title  = {SANE: The phases of gradient descent through Sharpness Adjusted Number of Effective parameters},
  author = {Lawrence Wang and Stephen J. Roberts},
  journal= {arXiv preprint arXiv:2305.18490},
  year   = {2023}
}