深度学习中的自适应摩擦:基于 Sigmoid 和 Tanh 函数的优化器增强
机器学习
2024-08-23 v1 人工智能
摘要
自适应优化器在引导深度神经网络的权重更新方面至关重要,但常面临泛化性能差和振荡问题。为此,我们引入 sigSignGrad 和 tanhSignGrad 两种新型优化器,将基于 Sigmoid 和 Tanh 函数的自适应摩擦系数集成到其中。这两种算法利用短期梯度信息——这是传统 Adam 变体(如 diffGrad 和 AngularGrad)所忽略的特征——来增强参数更新和收敛。我们的理论分析表明,摩擦系数 S 具有广泛的调整能力,这与针对特定参数更新策略的设计相一致,并在优化轨迹的平滑性和收敛速度方面优于现有方法。在 CIFAR-10、CIFAR-100 和 Mini-ImageNet 数据集上使用 ResNet50 和 ViT 架构进行的大量实验确认了我们所提出优化器的优越性能,展示了提高的准确率和减少的训练时间。将自适应摩擦系数作为插件集成到现有优化器中的创新方法, exemplified by sigSignAdamW 和 sigSignAdamP 变体,为提高既有算法的优化性能提供了前景。本研究的发现促进了深度学习中优化器设计的发展。
引用
@article{arxiv.2408.11839,
title = {Adaptive Friction in Deep Learning: Enhancing Optimizers with Sigmoid and Tanh Function},
author = {Hongye Zheng and Bingxing Wang and Minheng Xiao and Honglin Qin and Zhizhong Wu and Lianghao Tan},
journal= {arXiv preprint arXiv:2408.11839},
year = {2024}
}