GEM:面向有效下游适配的参数规模感知与分布敏感稀疏微调框架
机器学习
2025-08-25 v1
摘要
参数高效微调(PEFT)已成为将大规模预训练模型适配到新任务的流行方法。大多数 PEFT 方法仅更新部分参数而冻结其余参数,以避免冗余计算。由于它们在无视参数原始规模的情况下最大化更新的绝对大小,导致模型行为变化甚微。相比之下,我们对每个参数的规模进行相对最大化,从而实现更有意义的下游适配。我们提出梯度-权重比与熵导引掩码(GEM),即一种参数规模感知、分布敏感的稀疏微调框架。GEM 优先选择其更新相对于初始预训练值比例显著的参数,并基于参数值的熵自适应确定每层要调谐的参数数量,从而在 PEFT 中最有效地利用计算预算。我们的实证研究表明,GEM 在通用领域任务(GLUE 和 SuperGLUE)和特定领域任务(GSM8k 和 MBPP)上均表现有效,在仅更新 0.1% 模型参数的情况下,相较于完整微调可实现最高 1.6% 的微调准确率提升。
引用
@article{arxiv.2508.16191,
title = {GEM: A Scale-Aware and Distribution-Sensitive Sparse Fine-Tuning Framework for Effective Downstream Adaptation},
author = {Sungmin Kang and Jisoo Kim and Salman Avestimehr and Sunwoo Lee},
journal= {arXiv preprint arXiv:2508.16191},
year = {2025}
}