滚球优化器:通过熨平损失景观褶皱进行学习
机器学习
2025-10-27 v3 人工智能
最优化与控制
摘要
训练大型神经网络 需要优化高维且依赖数据的损失函数。这些函数的优化景观通常高度复杂且具有纹理感,甚至呈分形状,包含许多虚假局部极小值、病态谷值、退化点和鞍点。使问题进一步复杂化的是,这些景观特征是数据的函数,这意味着训练数据中的噪声可以向前传播并产生不代表真实情况的小尺度几何结构。这给基于梯度的优化方法带来了困难,这些方法依赖局部几何来计算更新,因此容易被噪声数据带偏。在实践中,这转化为优化动力学对数据中噪声的强烈依赖,即泛化性能差。为了解决这个问题,我们提出了一种新的优化过程:滚球优化器 (RBO),它通过在更新中融入损失景观更大区域的信息来打破这种空间局部性。我们通过模拟一个有限半径的刚性球体在损失景观上滚动的运动来实现这一点,这是梯度下降 (GD) 的直接推广,在无穷小极限下会简化为梯度下降。半径作为一个超参数,决定了 RBO 观察损失景观的尺度,从而允许控制其与之交互的粒度。我们的动机源于这样的直觉:损失景观的大尺度几何结构比其细粒度结构更少依赖于特定数据,并且更容易优化。我们通过证明我们的算法对损失函数具有平滑效应来支持这一直觉。在 MNIST 和 CIFAR-10/100 上与 SGD、SAM 和 Entropy-SGD 的评估表明,在收敛速度、训练精度和泛化性能方面均展现出有前景的结果。
引用
@article{arxiv.2505.19527,
title = {Rolling Ball Optimizer: Learning by ironing out loss landscape wrinkles},
author = {Mohammed Djameleddine Belgoumri and Mohamed Reda Bouadjenek and Hakim Hacid and Imran Razzak and Sunil Aryal},
journal= {arXiv preprint arXiv:2505.19527},
year = {2025}
}
备注
Submitted for review to ICLR 2026