基于内在文本锚的CLIP增量提示调优中的持续学习
计算机视觉与模式识别
2025-12-22 v3
摘要
持续学习(CL)使深度网络能够在获取新知识的同时避免灾�性遗忘。预训练模型(PTMs)如对比语言-图像预训练(CLIP)模型的强大泛化能力,启发了一系列针对新任务的CL方法,提供丰富的多模态嵌入,支持轻量级增量提示调优。现有方法常依赖基于特定假设构建的复杂设计,如针对提示池的精细正则化、专用路由机制或多阶段增量,引入额外且可能不必要的复杂性,未充分利用CLIP的内在能力。本文提出一种针对CLIP的简洁CL方法,基于增量提示调优充分利用其多模态结构和文本表示的稳定性。我们的方法,文本原型引导的提示调优(TPPT),将文本原型不仅作为静态分类器(如现有方法),更作为引导视觉提示学习的稳定锚点,从而塑造嵌入空间(即TPPT-V)。我们表明,双向监督策略使新知识的学习更有效,同时减少遗忘。为进一步在CL期间缩小视觉-语言间隙,我们联合优化视觉和文本提示(即TPPT-VT)。我们还引入文本锚点的关系多样性正则化,以防止嵌入空间坍缩并缓解相关遗忘。广泛实验和分析表明,我们的方法有效,凸显了充分利用CLIP内在指导进行持续适应的优势。
引用
@article{arxiv.2505.20680,
title = {Continual Learning on CLIP via Incremental Prompt Tuning with Intrinsic Textual Anchors},
author = {Haodong Lu and Xinyu Zhang and Kristen Moore and Jason Xue and Lina Yao and Anton van den Hengel and Dong Gong},
journal= {arXiv preprint arXiv:2505.20680},
year = {2025}
}
备注
Accepted at TMLR. Code is available at https://github.com/jeff024/tppt