当特征稀疏时误差反馈大放异彩
最优化与控制
2023-05-25 v1 分布式、并行与集群计算
机器学习
机器学习
摘要
我们首次证明,在求解分布式优化问题 min x ∈ R d f ( x ) = 1 n ∑ i = 1 n f i ( x ) \min_{x\in \mathbb{R}^d} {f(x)=\frac{1}{n}\sum_{i=1}^n f_i(x)} min x ∈ R d f ( x ) = n 1 ∑ i = 1 n f i ( x ) (其中 n n n = 客户端数量,d d d = 特征数量,且 f 1 , … , f n f_1,\dots,f_n f 1 , … , f n 为光滑非凸函数)时,带有贪婪稀疏化 ( T o p K ) \left({\color{green}\sf TopK}\right) ( TopK ) 与误差反馈 ( E F ) \left({\color{green}\sf EF}\right) ( EF ) 的梯度下降 ( G D ) \left({\color{green}\sf GD}\right) ( GD ) 可以比原始 G D {\color{green}\sf GD} GD 获得更好的通信复杂度。尽管自 2014 年 Seide 等人首次提出 E F {\color{green}\sf EF} EF 以来研究密集,该问题至今悬而未决。我们表明,当特征稀疏时,即每个特征仅出现在少数客户端所拥有的数据中时,E F {\color{green}\sf EF} EF 表现出色。为说明我们的主要结果,我们证明:为找到一个随机向量 x ^ \hat{x} x ^ 使得 ∥ ∇ f ( x ^ ) ∥ 2 ≤ ε \lVert {\nabla f(\hat{x})} \rVert^2 \leq \varepsilon ∥ ∇ f ( x ^ ) ∥ 2 ≤ ε 的期望成立,带有 T o p 1 {\color{green}\sf Top1} Top1 稀疏化器与 E F {\color{green}\sf EF} EF 的 G D {\color{green}\sf GD} GD 仅需每个工作节点向服务器发送 O ( ( L + r c n min ( c n max i L i 2 , 1 n ∑ i = 1 n L i 2 ) ) 1 ε ) {\cal O} \left(\left( L+{\color{blue}r} \sqrt{ \frac{{\color{red}c}}{n} \min \left( \frac{{\color{red}c}}{n} \max_i L_i^2, \frac{1}{n}\sum_{i=1}^n L_i^2 \right) }\right) \frac{1}{\varepsilon} \right) O ( ( L + r n c min ( n c max i L i 2 , n 1 ∑ i = 1 n L i 2 ) ) ε 1 ) 比特,其中 L L L 为 f f f 的光滑常数,L i L_i L i 为 f i f_i f i 的光滑常数,c {\color{red}c} c 为拥有任一特征的最大客户端数(1 ≤ c ≤ n 1\leq {\color{red}c} \leq n 1 ≤ c ≤ n ),r {\color{blue}r} r 为任一客户端拥有的最大特征数(1 ≤ r ≤ d 1\leq {\color{blue}r} \leq d 1 ≤ r ≤ d )。显然,通信复杂度随 c {\color{red}c} c 减小(即特征愈发稀疏)而改善,并可远优于同一情形下 G D {\color{green}\sf GD} GD 的 O ( r L 1 ε ) {\cal O}({\color{blue}r} L \frac{1}{\varepsilon}) O ( r L ε 1 ) 通信复杂度。
引用
@article{arxiv.2305.15264,
title = {Error Feedback Shines when Features are Rare},
author = {Peter Richtárik and Elnur Gasanov and Konstantin Burlachenko},
journal= {arXiv preprint arXiv:2305.15264},
year = {2023}
}