中文

零空间中的视觉提示调优用于持续学习

计算机视觉与模式识别 2024-10-29 v4 人工智能

摘要

现有的提示调优方法通过选择和更新视觉变换器模型中的相关提示,在持续学习中展示了令人印象深刻的性能。相反,本文旨在通过在与先前任务特征张成的子空间正交的方向上调优提示来学习每个任务,从而确保对已学习任务无干扰,以克服持续学习中的灾难性遗忘。然而,与传统的CNN架构中的正交投影不同,ViT架构中的提示梯度正交投影展现出完全不同且更大的挑战,即:1)高阶非线性自注意力操作;2)Transformer块中LayerNorm带来的提示分布漂移。理论上,我们最终推导出两个一致性条件来实现提示梯度正交投影,这为通过视觉提示调优中的自注意力机制消除对先前学习知识的干扰提供了理论保证。在实践中,我们提出了一种有效的基于零空间的近似解来实现提示梯度正交投影。大量的实验结果表明,在四个类增量基准测试中,使用多种预训练基线模型,我们的方法在抗遗忘方面有效,并且性能优于最先进的方法。我们的代码可在 https://github.com/zugexiaodui/VPTinNSforCL 获取。

关键词

引用

@article{arxiv.2406.05658,
  title  = {Visual Prompt Tuning in Null Space for Continual Learning},
  author = {Yue Lu and Shizhou Zhang and De Cheng and Yinghui Xing and Nannan Wang and Peng Wang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2406.05658},
  year   = {2024}
}

备注

Accepted by NeurIPS 2024