基于双向参数竞争的核化稀疏微调:面向视觉模型
计算机视觉与模式识别
2025-10-29 v1 机器学习
摘要
参数高效微调(PEFT)旨在将预训练视觉模型适配到下游任务。尽管稀疏调优在仅调整与下游任务最相关的权重方面取得了显著性能,但当前方法遵循两阶段范式:首先通过梯度信息定位任务相关权重,忽略微调期间的参数调整,限制了性能;其次仅对定位到的权重应用稀疏掩码更新,导致存储优化器中所有权重矩阵的高内存占用。本文提出一种名为 SNELLA 的单阶段方法,以克服上述局限。对于内存使用,SNELLA 通过将权重矩阵与由两个低秩可学习矩阵合并而成的稀疏矩阵相加,选择性地更新权重矩阵。我们通过引入非线性核函数扩展低秩分解,从而增加合并后矩阵的秩,以防止权重更新之间的相互依赖,实现对下游任务的更好适应。对于定位任务相关权重,我们提出一种自适应双向稀疏分配机制,在端到端方式下鼓励权重在层间和层内基于其重要性得分进行竞争。在使用不同预训练视觉模型进行分类、分割和生成任务的广泛实验中显示,SNELLA 以低内存占用实现了SOTA性能。值得注意的是,SNELLA 在 FGVC 数据集上相较于 SPT-LoRA 获得了 1.8%(91.9% vs. 90.1%)更高的 Top-1 准确率。相较于先前方法,SNELLA 在参数规模从 86M 到 632M 的模型上实现了 31.1%-39.9% 的内存降低。我们的源代码已在 https://github.com/ssfgunner/SNELL 提供。
引用
@article{arxiv.2510.24037,
title = {Kernelized Sparse Fine-Tuning with Bi-level Parameter Competition for Vision Models},
author = {Shufan Shen and Junshu Sun and Shuhui Wang and Qingming Huang},
journal= {arXiv preprint arXiv:2510.24037},
year = {2025}
}