中文

GNSP:用于保持VLMs持续学习中跨模态对齐的梯度零空间投影

机器学习 2025-07-29 v1 计算机视觉与模式识别

摘要

对比式语言-图像预训练(CLIP)通过在共享嵌入空间中对齐视觉和文本模态,展现了惊人的零样态泛化能力。然而,当在多样化任务上连续微调时,CLIP会遭受灾难性遗忘和嵌入对齐性能下降,削弱了其零样态能力。本文提出梯度零空间投影(Gradient Null Space Projection, GNSP),一种高效的持续学习方法,将任务特定梯度投影到先前学习知识的零空间中。这种正交投影在不依赖再训练或架构修改的情况下,数学上防止与先前任务的干扰。此外,为保留CLIP固有的泛化特性,我们引入知识蒸馏并结合一种受CLIP预训练启发的模态对齐保持损失,以稳定持续微调期间多模态嵌入空间的结构。在由11个任务组成的MTIL基准测试中,我们的方法在Average和Last两个关键指标上均实现了SOTA性能。更重要的是,实验表明,我们的方法成功保持了CLIP原始的模态差距和跨模态检索性能,确认了在持续学习过程中维持鲁棒视觉-语言空间的有效性。

关键词

引用

@article{arxiv.2507.19839,
  title  = {GNSP: Gradient Null Space Projection for Preserving Cross-Modal Alignment in VLMs Continual Learning},
  author = {Tiantian Peng and Yuyang Liu and Shuo Yang and Qiuhe Hong and YongHong Tian},
  journal= {arXiv preprint arXiv:2507.19839},
  year   = {2025}
}