以混淆因子剪枝知识提示支持视觉-语言模型推理
计算机视觉与模式识别
2024-03-26 v2
摘要
视觉-语言模型通过在公共空间中对齐图文对来预训练,以处理开放集视觉概念。为提升预训练模型的迁移性,近期工作采用固定或可学习提示,即从描述任务相关类别的自然语言中合成分类权重,以缩小训练与测试阶段任务间的差距。然而,何种提示以及提示如何能改善推理性能仍不清楚。本文明确阐明了在提示中包含语义信息的重要性,而现有提示方法生成提示时未探索文本标签的语义信息。手动构建富含语义的提示需要领域专业知识且极其耗时。为解决此问题,我们提出一种语义感知提示学习方法,即 CPKP,其通过将文本标签作为查询检索本体知识图来提取任务相关语义信息。CPKP 进一步引入双层混淆因子剪枝过程以精炼所得语义信息。图级混淆因子受 Granger 因果原理启发被逐步识别并剔除。特征级混淆因子依据信息论中的最大熵原理被消除。经验上,评估证明了 CPKP 的有效性,例如,在两次样本下,CPKP 平均优于手动提示方法 4.64%、优于可学习提示方法 1.09%,且相较于基准方法在域泛化上具优越性。我们的实现见 https://github.com/Mowenyii/CPKP。
引用
@article{arxiv.2205.11100,
title = {Supporting Vision-Language Model Inference with Confounder-pruning Knowledge Prompt},
author = {Jiangmeng Li and Wenyi Mo and Wenwen Qiang and Bing Su and Changwen Zheng and Hui Xiong and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2205.11100},
year = {2024}
}