中文

用于深度学习模型的张量正态训练

机器学习 2021-12-23 v3

摘要

尽管一阶方法在训练深度学习模型中占主导地位,二阶方法尤其是自然梯度方法仍因其利用曲率信息加速训练的潜力而受到关注。已有若干具有非对角预条件矩阵的方法被提出并证明有效,包括 KFAC、Shampoo 和 K-BFGS。基于所谓的张量正态(TN)分布,我们提出并分析了一种全新的近似自然梯度方法——张量正态训练(TNT),其与 Shampoo 类似,仅需知道训练参数的形状。通过近似基于概率的费舍尔矩阵而非经验费舍尔矩阵,我们的方法使用基于采样的梯度的分块协方差作为预条件矩阵。此外,假设基于采样的(张量)梯度服从 TN 分布,确保其协方差具有克罗内克可分离结构,从而得到对费舍尔矩阵的可处理近似。因此,TNT 的内存需求和每迭代计算成本仅比一阶方法略高。在我们的实验中,TNT 展现出优于最先进一阶方法的优化性能,并与最先进的二阶方法 KFAC 和 Shampoo 的优化性能相当。此外,TNT 证明了其泛化能力可与一阶方法媲美,同时使用了更少的训练轮数。

关键词

引用

@article{arxiv.2106.02925,
  title  = {Tensor Normal Training for Deep Learning Models},
  author = {Yi Ren and Donald Goldfarb},
  journal= {arXiv preprint arXiv:2106.02925},
  year   = {2021}
}