中文

平凡非凸性可导致复杂分形可训练边界

机器学习 2024-06-21 v1 动力系统 混沌动力学

摘要

训练神经网络涉及优化参数以最小化损失函数,其中损失函数的性质和优化策略对有效训练至关重要。超参数选择(如梯度下降中的学习率)显著影响收敛的成功性和速度。近期研究表明,可训练边界(即有界和发散超参数之间的边界)可能呈现分形结构,这使得可靠的超参数选择变得复杂。然而,这种分形边界的本质以及如何规避它仍不清楚。本研究聚焦于梯度下降 (GD),以探讨可能导致分形可训练边界的损失景观性质。我们发现,分形边界可从简单的非凸性扰动中产生,即向二次函数添加或乘以余弦型扰动。观察到的分形维数受参数维数、非凸性类型、扰动波长和扰动幅度等因素的影响。我们的分析识别了“扰动的粗糙度”这一指标——即梯度对参数变化敏感性的度量——作为控制可训练边界分形维数的关键因素。我们观察到随着粗糙度的增加,可训练边界从非分形向分形发生明显的转变,临界粗糙度导致扰动损失函数的非凸性。因此,我们得出结论,分形可训练边界可由非常简单的非凸性产生。我们预计这些发现将增进对神经网络训练期间复杂行为的理解,leading to more consistent and predictable training strategies. (Note: The last sentence in English is kept as is for accuracy, but should be translated in a proper Chinese academic context.)

关键词

引用

@article{arxiv.2406.13971,
  title  = {Complex fractal trainability boundary can arise from trivial non-convexity},
  author = {Yizhou Liu},
  journal= {arXiv preprint arXiv:2406.13971},
  year   = {2024}
}

备注

11 pages, 9 figures, preliminary tests