中文

别忘了非线性:解锁高效微调中的激活函数

机器学习 2025-09-19 v2

摘要

现有的高效参数微调 (PEFT) 方法主要针对权重矩阵进行适配,同时保持激活函数固定。我们提出了 NoRA——首个直接适配预训练 transformer 模型中非线性激活函数的 PEFT 框架。NoRA 将固定激活函数替换为可学习的有理函数,并对分子和分母系数施加结构化低秩更新,采用分组设计以局部化适配并在最小成本下提高稳定性。在在 CIFAR-10 和 CIFAR-100 上的视觉 transformer上,NoRA 在仅更新 0.4% 参数 (0.02M) 的情况下匹配或超越全参数微调,实现准确率提升 +0.17% 和 +0.27%。当与 LoRA 组合 (NoRA++) 时,可在更小的训练预算下超越 LoRA 和 DoRA,添加更少的可训练参数。在 LLaMA3-8B 指令调优任务中,NoRA++ 持续提升生成质量,平均 MMLU 得分提升 +0.3%--0.8%,包括 STEM (Alpaca) 提升 +1.6% 和 OpenOrca 提升 +1.3%。我们进一步表明,NoRA 将适配限制在低维函数子空间,从而在隐式约束更新幅度和方向方面实现正则化。这些结果确立了激活空间调谐作为高效参数 PEFT 的补充且高度高效的替代方案,使激活函数成为模型适配的首要对象。

关键词

引用

@article{arxiv.2509.13240,
  title  = {Don't Forget the Nonlinearity: Unlocking Activation Functions in Efficient Fine-Tuning},
  author = {Bo Yin and Xingyi Yang and Xinchao Wang},
  journal= {arXiv preprint arXiv:2509.13240},
  year   = {2025}
}