中文

增强 SignSGD:小批量收敛分析与混合切换策略

机器学习 2026-04-29 v1

摘要

SignSGD 将每个随机梯度坐标压缩为单比特,提供了显著的内存和通信节省,但其 1 比特量化去除了幅度信息,并已知相对于经过良好调优的 SGD 会留下泛化差距。我们从 1 比特量化和抖动的角度重新审视 SignSGD,并贡献了三项改进。首先,我们使用信噪比加权的平稳性度量,推导了在单峰对称梯度噪声下 SignSGD 的小批量收敛速率,消除了先前分析中的大批量假设。其次,我们在符号算子之前注入退火高斯噪声,这作为一种经典的抖动机制,概率性地恢复了因硬阈值而丢失的幅度信息。第三,我们将 SWATS 策略适配于基于符号的更新,采用基于投影的学习率校准,平滑地从 SignSGD 过渡到 SGD。在 ResNet-18 上的单工作者实验将优化器效应与通信方面隔离开来:符号前抖动在 CIFAR-100 上超越了 Adam,而校准切换在 CIFAR-10 上达到了 92.18% 的测试准确率,优于纯 SGD 的 91.38% 和带动量的纯 SignSGD 的 90.82%。

关键词

引用

@article{arxiv.2604.25550,
  title  = {Enhancing SignSGD: Small-Batch Convergence Analysis and a Hybrid Switching Strategy},
  author = {Haoran Chen and Wentao Wang},
  journal= {arXiv preprint arXiv:2604.25550},
  year   = {2026}
}

备注

5 pages, 3 figures