通过实例感知提示提高持续学习视觉语言模型的效果
计算机视觉与模式识别
2025-07-08 v2
摘要
最近的预训练视觉语言模型(PT-VLMs)常常面临多域任务增量学习(MTIL)场景,在该场景中,多个类和域的多模态任务会逐步到达。在无法访问以前看到的任务和看不到的任务的情况下,内存受限的MTIL会遭受前向和后向遗忘。为了缓解上述挑战,常用参数效率微调技术(PEFT),如提示调谐,来适应 PT-VLM 以应对越来越多的增量学习任务。为了实现有效的新任务适应,现有方法仅考虑PEFT策略选择的影响,但忽略了PEFT参数设置(如提示设计)的影响。在本文中,我们针对MTIL中不同任务的提示设计优化问题,提出了实例感知提示(IAP)框架。具体而言,我们的实例感知门控提示策略(IA-GP)通过在实例级别自适应分配各Transformer层的提示,增强了对新任务的适应性,同时缓解了遗忘。我们的实例感知类别分布驱动提示策略(IA-CDDP)通过确定每个实例与任务标签相关的准确置信度得分,提高了任务适应过程。跨11个数据集的实验评估,使用三个性能指标,证明了我们方法的有效性。源代码可在 https://github.com/FerdinandZJU/IAP 获取。
引用
@article{arxiv.2503.20612,
title = {IAP: Improving Continual Learning of Vision-Language Models via Instance-Aware Prompting},
author = {Hao Fu and Hanbin Zhao and Jiahua Dong and Henghui Ding and Chao Zhang and Hui Qian},
journal= {arXiv preprint arXiv:2503.20612},
year = {2025}
}
备注
Code can be found at https://github.com/FerdinandZJU/IAP