中文

基于自适应剪枝的牛顿法用于分布式学习

机器学习 2024-12-18 v4

摘要

牛顿法利用曲率信息来提升性能,因此在分布式学习问题中优于一阶方法。然而,由于 Hessian 矩阵的高计算与通信成本、子模型多样性、训练陈旧性以及数据异构性等障碍,牛顿法在大规模和异构学习环境中并不实用。为克服这些障碍,本文提出一种名为分布式自适应牛顿学习(Distributed Adaptive Newton Learning, \texttt{DANL})的新型高效算法,该算法通过简单的 Hessian 初始化和训练区域的自适应分配来解决牛顿法的缺陷。该算法展现出显著的收敛特性,并在随机优化的标准假设下进行了严格检验。理论分析证明 \texttt{DANL} 在高效适应可用资源并保持高效率的同时达到线性收敛速率。此外,\texttt{DANL} 对问题的条件数表现出显著的独立性,并消除了复杂参数调优的必要性。实验表明 \texttt{DANL} 在不同数据集上以高效通信和强劲性能实现了线性收敛。

关键词

引用

@article{arxiv.2308.10154,
  title  = {Adaptive pruning-based Newton's method for distributed learning},
  author = {Shuzhen Chen and Yuan Yuan and Youming Tao and Tianzhu Wang and Zhipeng Cai and Dongxiao Yu},
  journal= {arXiv preprint arXiv:2308.10154},
  year   = {2024}
}