中文

关于梯度变换与适配器之间的对偶性

机器学习 2025-08-12 v2 计算与语言

摘要

我们研究使用线性梯度变换的神经网络(特别是语言模型)的内存高效优化,其中梯度被线性映射到比完整参数空间更低维度的空间,从而节省梯度累积和优化器状态持久化所需的内存。模型参数的更新方式是:首先在低维空间中执行优化步骤,然后通过线性映射的转置返回原始参数空间。我们表明,在这个变换空间中优化模型等价于通过线性适配器对原始模型进行重参数化,该适配器以加法方式修改模型参数,随后仅优化该适配器的参数。当变换为 Kronecker 分解时,这建立了 GaLore 与单边 LoRA 之间的等价性。我们表明,梯度变换与基于适配器的重参数化之间的这种对偶性统一了现有的内存高效训练方法,并为提高训练效率和内存使用提供了新技术。

关键词

引用

@article{arxiv.2502.13811,
  title  = {On the Duality between Gradient Transformations and Adapters},
  author = {Lucas Torroba-Hennigen and Hunter Lang and Han Guo and Yoon Kim},
  journal= {arXiv preprint arXiv:2502.13811},
  year   = {2025}
}

备注

17 pages, 2 figures