中文

无过参数化神经网络损失景观的特征化

机器学习 2024-10-28 v3 最优化与控制 机器学习

摘要

优化方法在现代机器学习中发挥关键作用,支撑着深度学习模型的显著经验成就。尽管如此,这些成就即使令人惊叹,因为这些模型的损失景观具有复杂的非凸性质。然而,确保优化方法收敛需要目标函数具备特定的结构条件,而这些条件在实际中很少满足。一个突出例子是多项拉齐-约瓦茨(Polyak-Lojasiewicz, PL)不等式,近年来受到广泛关注。然而,验证此类假设对于深度神经网络意味着 substantial且往往不切实际的过参数化。在本文中,我们提出了一种新型函数类,用于表征现代深度模型的损失景观,而无需大量过参数化,并且可以包含鞍点。关键地,我们证明了在此假设下,基于梯度的优化器具有收敛性质的保证。最后,我们通过理论分析和实验验证了新函数类的有效性,涵盖多样化的深度学习模型。

关键词

引用

@article{arxiv.2410.12455,
  title  = {Loss Landscape Characterization of Neural Networks without Over-Parametrization},
  author = {Rustem Islamov and Niccolò Ajroldi and Antonio Orvieto and Aurelien Lucchi},
  journal= {arXiv preprint arXiv:2410.12455},
  year   = {2024}
}