基于知识引导上下文优化的视觉-语言提示微调
计算机视觉与模式识别
2023-03-24 v1 计算与语言
摘要
提示微调(prompt tuning)是一种利用任务相关文本标记将预训练视觉-语言模型(VLM)适配到下游任务的有效方式。代表性的基于 CoOp 的工作将可学习文本标记与类标记结合以获得特定文本知识。然而,特定文本知识对未见类的泛化能力较差,因为它遗忘了具有强泛化能力的本质通用文本知识。为解决此问题,我们引入一种新颖的知识引导上下文优化(Knowledge-guided Context Optimization, KgCoOp)来增强可学习提示对未见类的泛化能力。KgCoOp 的核心思想是,可通过减小可学习提示与手工提示之间的差异来缓解本质知识的遗忘。具体而言,KgCoOp 最小化由学习到的提示生成的文本嵌入与手工提示之间的差距。最后,在对比损失上加入 KgCoOp 可为已见和未见任务生成具有判别性的提示。在多个基准上的广泛评估表明,所提出的知识引导上下文优化是一种高效的提示微调方法,即在更短训练时间内取得更好性能。
引用
@article{arxiv.2303.13283,
title = {Visual-Language Prompt Tuning with Knowledge-guided Context Optimization},
author = {Hantao Yao and Rui Zhang and Changsheng Xu},
journal= {arXiv preprint arXiv:2303.13283},
year = {2023}
}
备注
accepted by CVPR23