中文

iGSP:基于隐式梯度子空间投影的高效持续学习视觉语言模型

计算机视觉与模式识别 2026-05-20 v1

摘要

视觉语言模型需要高效适应不断出现的下游任务。虽然参数高效微调缓解了灾�性遗忘,但为每个任务分配独立模块会导致参数激增。相反,近期的基于相似性驱动的共享机制将表面的视觉相似性等同于底层对齐一致性。这种根本性的不匹配会导致视觉相似但逻辑不同的任务之间严重的负迁移,无法利用跨视觉多样性的对齐复用。我们认为,对齐共享本质上是共享低秩子空间内优化轨迹重叠的几何问题。基于此洞见,我们提出 iGSP,通过隐式梯度子空间投影实现高效适应。利用 MoE 路由器早期收敛建立子空间基,iGSP 将适应过程分为两个阶段。首先,子空间识别阶段通过基准预扩展引入候选专家,应用新颖的子空间约束正则化隐式投射新任务梯度到历史子空间,并通过将路由概率作为梯度流指示器精确修剪冗余维度,从而最大化知识复用。其次,正交子空间微调阶段固定该结构基准并移除正则化,以快速拟合任务特定的残差损失。在 MTIL 基准上的大量实验表明,iGSP 在保持卓越精度的同时,显著提高了训练效率,训练参数平均减少 42.7%,总参数减少 86.9%。源码可在 https://github.com/GeoX-Lab/iGSP 查看。

关键词

引用

@article{arxiv.2605.19301,
  title  = {iGSP:Implicit Gradient Subspace Projection for Efficient Continual Learning of Vision-Language Models},
  author = {Xuezhi Cui and Dongbo Zhou and Wang Guo and Zeyuan Wang and Ziyu Li and Gaozhi Zhou and Xian Li and Ling Zhao and Wentao Yang and Chao Tao and Haifeng Li},
  journal= {arXiv preprint arXiv:2605.19301},
  year   = {2026}
}