中文

基于部分梯度的神经网络掩码训练

机器学习 2022-03-23 v3

摘要

深度学习模型的最先进训练算法基于随机梯度下降(SGD)。近来已探索多种变体:扰动参数以提升精度(如 Extragradient)、将 SGD 更新限制于参数子集以提高效率(如 meProp)或二者结合(如 Dropout)。然而,这些方法的收敛性常在理论上未被研究。我们提出一个统一的理论框架来研究此类 SGD 变体——涵盖上述算法,并额外涵盖广泛用于通信高效训练或模型压缩的多种方法。我们的见解可用作指南,以提升此类方法的效率并促进向新应用的推广。作为一个示例,我们处理联合训练网络的任务,其一个版本(限于子网络)被用于创建 Slimmable Networks。通过联合训练一个低秩 Transformer 与一个标准 Transformer,我们获得了优于单独训练时的性能。

关键词

引用

@article{arxiv.2106.08895,
  title  = {Masked Training of Neural Networks with Partial Gradients},
  author = {Amirkeivan Mohtashami and Martin Jaggi and Sebastian U. Stich},
  journal= {arXiv preprint arXiv:2106.08895},
  year   = {2022}
}

备注

Proceedings of the 25th International Conference on Artificial Intelligence and Statistics (AISTATS) 2022