中文

基于预训练模型正则化的梯度微调

机器学习 2025-07-02 v1 人工智能 计算机视觉与模式识别

摘要

大型预训练模型已在多个领域展现出广泛应用前景。然而,为特定下游任务微调这些模型需要巨大的计算资源和存储空间。一种微调方法,即梯度基参数选择(GPS),聚焦于仅微调每个神经元中梯度最高的参数,从而减少训练参数的数量。然而,这种方法会增加计算资源要求和存储需求。本文提出一种高效的梯度基正则化微调方法(GRFT),更新权矩阵的行或列。我们理论地表明,梯度平方和最高的行或列是最优更新目标。这一策略有效减少了存储开销,提高了参数选择的效率。此外,我们引入正则化以增强从预训练模型传递的知识。GRFT 实现了最先进的性能,超越了 GPS、Adapter Tuning 和 LoRA 等现有方法。值得注意的是,GRFT 在 FGVC 和 VTAB 数据集上仅需更新总参数的 1.22% 和 0.30%,显示出其高效和有效。该源代码将很快公开。

关键词

引用

@article{arxiv.2507.00016,
  title  = {Gradient-based Fine-Tuning through Pre-trained Model Regularization},
  author = {Xuanbo Liu and Liu Liu and Fuxiang Wu and Fusheng Hao and Xianglong Liu},
  journal= {arXiv preprint arXiv:2507.00016},
  year   = {2025}
}