中文

误差反馈可精确压缩预条件子

机器学习 2024-06-06 v5 数值分析 数值分析 最优化与控制

摘要

在深度网络规模上利用关于损失的二阶信息,是当前改进深度学习优化器性能的主要途径之一。然而,现有的精确全矩阵预条件方法,如全矩阵 Adagrad (GGT) 或无矩阵近似曲率 (M-FAC),即使在小规模模型上应用时也会产生巨大的存储开销,因为它们必须存储一个滑动窗口的梯度,其内存需求在模型维度上呈乘性增长。本文通过一种新颖高效的误差反馈技术解决该问题,该技术可在不损失收敛性的前提下,将预条件子在实践中压缩高达两个数量级。具体而言,我们的方法在梯度信息送入预条件子之前通过稀疏化或低秩压缩对其进行压缩,并将压缩误差反馈至后续迭代。在深度神经网络上的实验表明,该方法可将全矩阵预条件子压缩至 99% 稀疏度而无精度损失,有效消除了 GGT 和 M-FAC 等全矩阵预条件子的内存开销。我们的代码见 \url{https://github.com/IST-DASLab/EFCP}。

关键词

引用

@article{arxiv.2306.06098,
  title  = {Error Feedback Can Accurately Compress Preconditioners},
  author = {Ionut-Vlad Modoranu and Aleksei Kalinov and Eldar Kurtic and Elias Frantar and Dan Alistarh},
  journal= {arXiv preprint arXiv:2306.06098},
  year   = {2024}
}