平凡非凸性可导致复杂分形可训练边界
机器学习
2024-06-21 v1 动力系统
混沌动力学
摘要
训练神经网络涉及优化参数以最小化损失函数,其中损失函数的性质和优化策略对有效训练至关重要。超参数选择(如梯度下降中的学习率)显著影响收敛的成功性和速度。近期研究表明,可训练边界(即有界和发散超参数之间的边界)可能呈现分形结构,这使得可靠的超参数选择变得复杂。然而,这种分形边界的本质以及如何规避它仍不清楚。本研究聚焦于梯度下降 (GD),以探讨可能导致分形可训练边界的损失景观性质。我们发现,分形边界可从简单的非凸性扰动中产生,即向二次函数添加或乘以余弦型扰动。观察到的分形维数受参数维数、非凸性类型、扰动波长和扰动幅度等因素的影响。我们的分析识别了“扰动的粗糙度”这一指标——即梯度对参数变化敏感性的度量——作为控制可训练边界分形维数的关键因素。我们观察到随着粗糙度的增加,可训练边界从非分形向分形发生明显的转变,临界粗糙度导致扰动损失函数的非凸性。因此,我们得出结论,分形可训练边界可由非常简单的非凸性产生。我们预计这些发现将增进对神经网络训练期间复杂行为的理解,leading to more consistent and predictable training strategies. (Note: The last sentence in English is kept as is for accuracy, but should be translated in a proper Chinese academic context.)
引用
@article{arxiv.2406.13971,
title = {Complex fractal trainability boundary can arise from trivial non-convexity},
author = {Yizhou Liu},
journal= {arXiv preprint arXiv:2406.13971},
year = {2024}
}
备注
11 pages, 9 figures, preliminary tests