中文

SMMF:方阵化动量分解以实现内存高效优化

机器学习 2025-05-01 v2 人工智能

摘要

我们提出了 SMMF(Square-Matricized Momentum Factorization),一种内存高效的优化器,通过将广泛使用的自适应学习率优化器(如 Adam)的内存需求降低最高可达 96%。SMMF 基于方阵化和一次性单矩阵分解,实现了对任意秩(形状)的一阶和二阶动量张量的灵活且高效的分解。因此,它可有效应用于任意秩(形状)的动量张量,即偏置、矩阵以及任意 d 维张量,这些在各种深度模型架构中广泛存在,如 CNN(高秩)和 Transformer(低秩),而与现有的内存高效优化器仅适用于特定(秩-2)动量张量的做法(例如线性层)形成鲜明对比。我们对 SMMF 进行了懊悼界分析,表明其收敛性类似于非内存高效的自适应学习率优化器(如 AdamNC),为其竞争性优化能力提供了理论依据。在实验中,SMMF 比当前最先进的内存高效优化器(如 Adafactor、CAME 和 SM3)占用的内存最多降低 96%,同时在 various CNN 和 Transformer 任务上实现了可比的模型性能。

关键词

引用

@article{arxiv.2412.08894,
  title  = {SMMF: Square-Matricized Momentum Factorization for Memory-Efficient Optimization},
  author = {Kwangryeol Park and Seulki Lee},
  journal= {arXiv preprint arXiv:2412.08894},
  year   = {2025}
}