面向视觉-语言模型的基于多知识表示的提示学习优化
计算机视觉与模式识别
2025-08-19 v3
摘要
视觉-语言模型(VLM),如 CLIP,在各种跨模态应用中扮演着基础性角色。为充分利用 VLM 适应下游任务的潜力,诸如提示微调(Prompt Tuning)之类的上下文优化方法至关重要。然而,一个关键限制是提示模板缺乏多样性,无论它们是手工设计的还是通过附加模块学习的。这一限制约束了预训练 VLM 的能力,并可能导致下游任务中的错误预测。为应对这一挑战,我们提出了基于多知识表示的上下文优化(CoKnow),这是一个通过丰富的上下文知识增强 VLM 提示学习的框架。为在推理过程中便于使用 CoKnow,我们训练了轻量级的语义知识映射器,它们能够为输入图像生成多知识表示,而无需额外的先验信息。在实验上,我们在 11 个公开可用的数据集上进行了广泛实验,证明 CoKnow 优于一系列先前的方法。
引用
@article{arxiv.2404.10357,
title = {Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models},
author = {Enming Zhang and Bingke Zhu and Yingying Chen and Qinghai Miao and Ming Tang and Jinqiao Wang},
journal= {arXiv preprint arXiv:2404.10357},
year = {2025}
}