非对称动量:对梯度下降的反思
机器学习
2023-10-04 v2
摘要
通过理论与实验验证,不同于所有现有如Adam般惩罚频繁变化参数且仅适用于稀疏梯度的自适应方法,我们提出最简单的SGD增强方法——损失控制非对称动量(LCAM)。通过对损失取平均,我们将训练过程划分为不同损失阶段并使用不同动量。它不仅可像自适应优化器那样对稀疏梯度加速慢变化参数,也可选择对非负散梯度加速频繁变化参数,从而适应所有类型数据集。我们通过权重耦合与权重牵引概念重新诠释机器学习训练过程,并实验验证权重具有方向特异性,且与数据集特异性相关。因此有趣地,我们观察到在非负散梯度中频繁变化参数实际上应被加速,这与传统自适应视角完全相反。相比带动量的传统SGD,该算法在无额外计算成本下分离权重。值得注意的是,此方法依赖网络提取复杂特征的能力。我们主要使用宽残差网络(Wide Residual Networks)进行研究,采用经典数据集Cifar10与Cifar100测试特征分离能力,并得出比准确率更为重要现象。最后,相比经典SGD调参方法,在这两个数据集上使用WRN且以近半训练轮数,我们取得了持平或更优测试精度。
引用
@article{arxiv.2309.02130,
title = {Asymmetric Momentum: A Rethinking of Gradient Descent},
author = {Gongyue Zhang and Dinghuang Zhang and Shuwen Zhao and Donghan Liu and Carrie M. Toptan and Honghai Liu},
journal= {arXiv preprint arXiv:2309.02130},
year = {2023}
}