中文

量化自适应次梯度算法及其应用

机器学习 2022-08-12 v1 人工智能

摘要

数据爆炸与模型规模增长推动了大规模机器学习的显著进步,但也使模型训练耗时、模型存储困难。在具有较高计算效率和较少设备限制的分布式模型训练设定中,仍存在两个主要困难。一方面,交换信息(如不同工作节点间的随机梯度)的通信成本是分布式训练效率的关键瓶颈。另一方面,参数较少的模型易于存储和通信,但有损模型性能的风险。为同时平衡通信成本、模型容量与模型性能,我们提出用于分布式训练的量化复合镜像下降自适应次梯度(QCMD adagrad)与量化正则化对偶平均自适应次梯度(QRDA adagrad)。具体而言,我们探索梯度量化与稀疏模型的结合,以降低分布式训练每次迭代的通信成本。构建了基于量化梯度的自适应学习率矩阵,以实现通信成本、精度与模型稀疏性之间的平衡。此外,我们从理论上发现较大的量化误差会带来额外噪声,影响模型的收敛性与稀疏性。因此,QCMD adagrad 与 QRDA adagrad 采用误差相对较小的阈值量化策略,以提高信噪比并保持模型稀疏性。理论分析与实验结果均证明了所提算法的有效性与高效性。

关键词

引用

@article{arxiv.2208.05631,
  title  = {Quantized Adaptive Subgradient Algorithms and Their Applications},
  author = {Ke Xu and Jianqiao Wangni and Yifan Zhang and Deheng Ye and Jiaxiang Wu and Peilin Zhao},
  journal= {arXiv preprint arXiv:2208.05631},
  year   = {2022}
}