改进型自适应 PID 优化器:增强深度学习中的收敛性与稳定性
机器学习
2026-05-22 v1
摘要
深度学习中的优化是核心环节。大多数优化器所基于的基础方法是动量式随机梯度下降。然而,它存在两个关键缺陷:其梯度噪声且变化剧烈,以及出现超调现象。为解决噪声梯度问题,提出了 Adam 方法,至今仍是最广泛使用的自适应优化器。为解决超调现象,提出了基于控制论的 PID 优化器。为在单一框架内解决上述局限性,最近提出了若干自适应 PID(AdaPID)变体。尽管 AdaPID 表现良好,但仍继承 Adam 的两个关键缺陷:收敛性和稳定性问题。本文针对这两个局限性进行解决。为解决收敛问题,我们独特地将使用非递增有效学习率的思想整合到 AdaPID 中(原来在 AMSGrad 中提出,是 Adam 的扩展)。为解决稳定问题,我们创新性地将基于梯度差的调制因子整合到 AdaPID 中(原来在 DiffGrad 中提出,是另一个 Adam 的扩展)。将两者结合于 AdaPID 中,形成我们 novel 的 IAdaPID-ADG 优化器。我们在多个数据集上评估所提出的优化器,包括基准数据集(MNIST 和 CIFAR10)和真实世界数据集(IARC 和 AnnoCerv)。IAdaPID-ADG 在所有竞争性优化器中均显著优于它们。此外,我们对在 MNIST 数据集上的消融研究旨在说明每个添加组件的贡献。
引用
@article{arxiv.2605.21968,
title = {An Improved Adaptive PID Optimizer with Enhanced Convergence and Stability for Deep Learning},
author = {Saurabh Saini and Kapil Ahuja and Thomas Wick and Saurav Kumar},
journal= {arXiv preprint arXiv:2605.21968},
year = {2026}
}
备注
11 Pages, Double Column, 6 Tables, 5 Figures