中文

KrADagrad:基于克罗内克近似主导的梯度预条件随机优化

机器学习 2023-06-01 v1 机器学习

摘要

二阶随机优化器可使参数更新步长和方向适应损失曲率,但传统上所需内存和计算量过大,不适用于深度学习。近来,Shampoo [Gupta et al., 2018] 引入了克罗内克因子化预条件器以降低这些需求:它已被用于大型深度模型 [Anil et al., 2020] 及生产环境 [Anil et al., 2022]。然而,它需要对病态矩阵求逆矩阵根,这需要 64 位精度,带来了严格的硬件限制。本文中,我们提出一种新颖的因子化方法——克罗内克近似主导(KrAD)。利用 KrAD,我们更新一个直接近似逆经验 Fisher 矩阵(如同全矩阵 AdaGrad)的矩阵,从而避免求逆及由此带来的 64 位精度需求。随后我们提出 KrADagrad^\star,其计算成本与 Shampoo 相近且 regret(遗憾值)相同。合成病态实验表明,在 32 位精度下其性能优于 Shampoo;而在多个真实数据集上,我们的泛化性能相当或更好。

关键词

引用

@article{arxiv.2305.19416,
  title  = {KrADagrad: Kronecker Approximation-Domination Gradient Preconditioned Stochastic Optimization},
  author = {Jonathan Mei and Alexander Moreno and Luke Walters},
  journal= {arXiv preprint arXiv:2305.19416},
  year   = {2023}
}

备注

Accepted in "Uncertainty in Artificial Intelligence" (2023)