SparseGrad:面向 MLP 层高效微调的选择性方法
计算与语言
2024-10-11 v1 人工智能
摘要
Transformer 模型的性能提升依赖于参数数量和处理文本长度的增加。因此,对整个模型进行微调变得内存密集。高性能的参数高效微调(PEFT)方法通常针对 Attention 块,忽略了约占模型参数总量的一半的 MLP 块。我们提出一种新的选择性 PEFT 方法,称为 SparseGrad,专注于 MLP 块。我们将层梯度传输至一个仅保留约 1% 元素显著性的空间,通过将梯度转换为稀疏结构来减少更新参数的数量。我们将 SparseGrad 应用于在 NLU 任务上对 BERT 和 RoBERTa 进行微调,以及对 LLaMa-2进行问答任务微调。在这些实验中,在相同内存要求下,我们的方法超越了 LoRA 和 MeProp 等主流 SOTA PEFT 方法。
引用
@article{arxiv.2410.07383,
title = {SparseGrad: A Selective Method for Efficient Fine-tuning of MLP Layers},
author = {Viktoriia Chekalina and Anna Rudenko and Gleb Mezentsev and Alexander Mikhalev and Alexander Panchenko and Ivan Oseledets},
journal= {arXiv preprint arXiv:2410.07383},
year = {2024}
}