AYLA:通过损失变换放大梯度灵敏度以实现非凸优化
机器学习
2025-06-25 v2
摘要
随机梯度下降(SGD)及其变体(如ADAM)是深度学习优化的基石,依据损失函数梯度通过固定或自适应学习率调整模型参数。然而,这些方法在高维非凸场景中常难以在可适应性与效率之间取得平衡。本文引入AYLA,一种通过损失函数变换来提升训练动力学的新型优化框架。AYLA对损失函数施加可调幂律变换,保持关键点不变,同时将损失值缩放以放大梯度灵敏度并加速收敛。此外,我们提出一种有效学习率,动态适应变换后的损失,从而进一步提高优化效率。在最小化合成非凸多项式、求解非凸曲线拟合任务以及进行数字分类(MNIST)和图像识别(CIFAR-100)等实验评估中,AYLA在收敛速度和训练稳定性方面 consistently优于SGD和ADAM。通过重塑损失景观,AYLA为现有优化方法提供一种无模型依赖的提升,为深度神经网络训练提供了一项有前景的进步。
引用
@article{arxiv.2504.01875,
title = {AYLA: Amplifying Gradient Sensitivity via Loss Transformation in Non-Convex Optimization},
author = {Ben Keslaki},
journal= {arXiv preprint arXiv:2504.01875},
year = {2025}
}