Eva:一种用于二阶优化的通用向量化近似框架
机器学习
2023-08-07 v1 最优化与控制
摘要
二阶优化算法在训练深度学习模型时展现出优异的收敛性质,但常带来显著的计算与内存开销,导致其训练效率可能低于随机梯度下降(SGD)等一阶算法。本工作中,我们提出一种内存与时间高效的二阶算法 Eva,包含两项新技术:1)我们利用小随机向量在训练小批量数据上的 Kronecker 分解来构造二阶信息,以降低内存消耗;2)我们利用 Sherman-Morrison 公式推导出不显式计算矩阵逆的高效更新公式。我们进一步将 Eva 扩展为一个通用向量化近似框架,在不影响收敛性能的前提下提升两种已有二阶算法(FOOF 与 Shampoo)的计算与内存效率。在不同模型与数据集上的大量实验结果表明,相较于的一阶 SGD 与二阶算法(K-FAC 与 Shampoo),Eva 分别将端到端训练时间最多降低 2.05 倍与 2.42 倍。
引用
@article{arxiv.2308.02123,
title = {Eva: A General Vectorized Approximation Framework for Second-order Optimization},
author = {Lin Zhang and Shaohuai Shi and Bo Li},
journal= {arXiv preprint arXiv:2308.02123},
year = {2023}
}
备注
Extension of ICLR2022 Practical second-order optimization with Kronecker-vectorized approximation