中文

MATCHA:通过匹配分解采样加速去中心化 SGD

机器学习 2019-11-19 v3 系统与控制 最优化与控制 机器学习

摘要

本文研究在使用给定网络基于随机梯度下降(SGD)进行去中心化训练时通常遇到的误差—运行时间权衡问题。较稠密(稀疏)的网络拓扑在迭代次数上带来更快(更慢)的误差收敛,但每次迭代产生更多(更少)的通信时间/延迟。本文提出 MATCHA 算法,可在任意网络拓扑下于该误差—运行时间权衡中实现双赢。MATCHA 的核心思想是通过将拓扑分解为匹配来并行化节点间通信。为保持快速的误差收敛速度,它识别关键链路并更频繁地在其上通信,同时通过降低其他链路的使用频率来节省通信时间。在一系列数据集和深度神经网络上的实验验证了理论分析,并表明 MATCHA 达到相同训练损失所需时间比朴素去中心化 SGD 最多少 5×5\times

关键词

引用

@article{arxiv.1905.09435,
  title  = {MATCHA: Speeding Up Decentralized SGD via Matching Decomposition Sampling},
  author = {Jianyu Wang and Anit Kumar Sahu and Zhouyi Yang and Gauri Joshi and Soummya Kar},
  journal= {arXiv preprint arXiv:1905.09435},
  year   = {2019}
}