局部更新方法中学习率被高估的重要性
机器学习
2020-07-03 v1 最优化与控制
机器学习
摘要
我们研究一类我们称之为局部更新方法的算法,它推广了诸多联邦学习与元学习算法。我们证明,对于二次目标函数,局部更新方法在我们对之精确刻画的代理损失函数上执行随机梯度下降。我们表明,客户端学习率的选择控制了该代理损失函数的条件数,以及代理损失与真实损失函数极小化点之间的距离。我们利用该理论推导了联邦平均(federated averaging)的新收敛速率,展示了代理损失条件数与其和真实损失函数对齐程度之间的权衡。我们通过实验验证了结果,表明在通信受限设定下,恰当的学习率调优通常足以达到近最优行为。我们还提出了一种用于局部更新方法中自动学习率衰减的实用方法,有助于减少对学习率调优的需求,并展示了其在多种任务和数据集上的经验性能。
引用
@article{arxiv.2007.00878,
title = {On the Outsized Importance of Learning Rates in Local Update Methods},
author = {Zachary Charles and Jakub Konečný},
journal= {arXiv preprint arXiv:2007.00878},
year = {2020}
}