中文

AYLA:通过损失变换放大梯度灵敏度以实现非凸优化

机器学习 2025-06-25 v2

摘要

随机梯度下降(SGD)及其变体(如ADAM)是深度学习优化的基石,依据损失函数梯度通过固定或自适应学习率调整模型参数。然而,这些方法在高维非凸场景中常难以在可适应性与效率之间取得平衡。本文引入AYLA,一种通过损失函数变换来提升训练动力学的新型优化框架。AYLA对损失函数施加可调幂律变换,保持关键点不变,同时将损失值缩放以放大梯度灵敏度并加速收敛。此外,我们提出一种有效学习率,动态适应变换后的损失,从而进一步提高优化效率。在最小化合成非凸多项式、求解非凸曲线拟合任务以及进行数字分类(MNIST)和图像识别(CIFAR-100)等实验评估中,AYLA在收敛速度和训练稳定性方面 consistently优于SGD和ADAM。通过重塑损失景观,AYLA为现有优化方法提供一种无模型依赖的提升,为深度神经网络训练提供了一项有前景的进步。

关键词

引用

@article{arxiv.2504.01875,
  title  = {AYLA: Amplifying Gradient Sensitivity via Loss Transformation in Non-Convex Optimization},
  author = {Ben Keslaki},
  journal= {arXiv preprint arXiv:2504.01875},
  year   = {2025}
}