中文

基于符号的随机重排算法在非凸优化中的收敛性

机器学习 2026-01-09 v3 分布式、并行与集群计算 最优化与控制 机器学习

摘要

signSGD 因其通信高效性在非凸优化中很受欢迎。然而,现有分析通常假设每轮迭代中数据是有放回采样的,这与一种常见的实际实现相矛盾,即数据被随机重排并顺序输入算法。这一差距使得对更实用算法——带随机重排的 signSGD(SignRR)——的理论理解在很大程度上未被探索。我们开发了 SignRR 的首个分析,以识别阻碍该方法彻底收敛分析的核心技术挑战。具体而言,给定大小为 nn 的数据集和 TT 个 epoch,我们证明 SignRR 的期望梯度范数上界为 O(log(nT)/nT+σ)O(\log(nT)/\sqrt{nT} + \sigma),其中 σ\sigma 是平均条件均方误差,其未必趋于零。为应对此局限,我们在随机重排下开发了两种新的基于符号的算法:SignRVR(引入方差缩减梯度)和 SignRVM(集成基于动量的更新)。两种算法均实现了更快的收敛速率 O(log(nT)/nT+log(nT)n/T){O}(\log(nT)/\sqrt{nT} +\log(nT)\sqrt{n}/\sqrt{T})。我们进一步将算法扩展到分布式设置,收敛速率为 O(log(n0T)/n0T+log(n0T)n0/T){O}(\log(n_0T)/\sqrt{n_0T} +\log (n_0T)\sqrt{n_0}/\sqrt{T}),其中 n0n_0 是单台机器的数据集大小。这些结果标志着对基于符号的优化算法实际实现的理论理解的第一步。最后,我们通过模拟与真实世界问题的实验支撑了理论发现,验证了随机重排的符号方法匹配或超越了现有基线。

关键词

引用

@article{arxiv.2310.15976,
  title  = {Convergence of Sign-based Random Reshuffling Algorithms for Nonconvex Optimization},
  author = {Zhen Qin and Zhishuai Liu and Pan Xu},
  journal= {arXiv preprint arXiv:2310.15976},
  year   = {2026}
}

备注

37 pages, 5 figures