中文

用于训练广义线性模型的全矩阵预条件器的动态低秩近似

机器学习 2025-09-01 v1 人工智能

摘要

自适应梯度方法,如Adagrad及其变体,在大规模优化中广泛应用。然而,由于其使用对角预条件矩阵,限制了捕获参数相关性的能力。全矩阵自适应方法通过近似exact Hessian来建模这些相关性,可能实现更快的收敛。同时,它们的计算和内存开销常常对大规模模型而言是不可接受的。为解决这一局限性,我们提出了AdaGram,这是一个能够实现高效全矩阵自适应梯度更新的优化器。为减少内存和计算开销,我们利用快速对称分解来计算每个迭代的预条件化更新方向。此外,我们使用矩阵积分方法维持预条件器在优化轨迹中的低秩结构。数值实验表明,在使用秩五或更小秩近似的情况下,AdaGram的收敛速度快于或与对角自适应优化器相当。这表明AdaGram作为大规模模型中自适应优化的可扩展解决方案具有潜力。

关键词

引用

@article{arxiv.2508.21106,
  title  = {Dynamic Low-rank Approximation of Full-Matrix Preconditioner for Training Generalized Linear Models},
  author = {Tatyana Matveeva and Aleksandr Katrutsa and Evgeny Frolov},
  journal= {arXiv preprint arXiv:2508.21106},
  year   = {2025}
}