中文

基于内在文本锚的CLIP增量提示调优中的持续学习

计算机视觉与模式识别 2025-12-22 v3

摘要

持续学习(CL)使深度网络能够在获取新知识的同时避免灾�性遗忘。预训练模型(PTMs)如对比语言-图像预训练(CLIP)模型的强大泛化能力,启发了一系列针对新任务的CL方法,提供丰富的多模态嵌入,支持轻量级增量提示调优。现有方法常依赖基于特定假设构建的复杂设计,如针对提示池的精细正则化、专用路由机制或多阶段增量,引入额外且可能不必要的复杂性,未充分利用CLIP的内在能力。本文提出一种针对CLIP的简洁CL方法,基于增量提示调优充分利用其多模态结构和文本表示的稳定性。我们的方法,文本原型引导的提示调优(TPPT),将文本原型不仅作为静态分类器(如现有方法),更作为引导视觉提示学习的稳定锚点,从而塑造嵌入空间(即TPPT-V)。我们表明,双向监督策略使新知识的学习更有效,同时减少遗忘。为进一步在CL期间缩小视觉-语言间隙,我们联合优化视觉和文本提示(即TPPT-VT)。我们还引入文本锚点的关系多样性正则化,以防止嵌入空间坍缩并缓解相关遗忘。广泛实验和分析表明,我们的方法有效,凸显了充分利用CLIP内在指导进行持续适应的优势。

关键词

引用

@article{arxiv.2505.20680,
  title  = {Continual Learning on CLIP via Incremental Prompt Tuning with Intrinsic Textual Anchors},
  author = {Haodong Lu and Xinyu Zhang and Kristen Moore and Jason Xue and Lina Yao and Anton van den Hengel and Dong Gong},
  journal= {arXiv preprint arXiv:2505.20680},
  year   = {2025}
}

备注

Accepted at TMLR. Code is available at https://github.com/jeff024/tppt