中文

面向提示学习的即插即用类别感知知识注入框架

计算机视觉与模式识别 2026-05-08 v1

摘要

提示学习已成为增强视觉语言模型 (VLM) 如 CLIP 以适应各种下游任务的有效且广泛使用的技术,尤其在特定领域的零样本分类中。现有方法通常 focus于学习给定领域的类别共享提示,或通过条件提示学习生成实例特定提示。虽然这些方法取得了令人满意的性能,但常常忽视提示设计中的类别特定知识,导致次优结果。其根本原因在于:1) 类别特定提示相较于粗糙的类别共享提示提供更细粒度的监督,这有助于防止来自不同类别的数据被归入单一类别;2) 相较于类别特定提示,实例特定提示忽略了跨多个实例的更丰富类别级信息,可能导致同一类别的数据被划分为多个类别。为有效将类别特定知识注入现有方法,我们提出了即插即用类别感知知识注入 (Class-Aware Knowledge Injection, CAKI) 框架。CAKI 包含两个关键组件,即类别特定提示生成与查询-键提示匹配。前者从属于同一类别的少数样本中编码类别特定知识,并将学习到的提示存储在类别级知识库中。后者为每个测试实例提供即插即用机制,从知识库中检索相关类别级知识并注入以细化模型预测。广泛的实验表明,CAKI 在基座类别和新类别上有效提升了现有方法的性能。代码已公开于 \href{https://github.com/yjh576/CAKI}{this https URL}。

关键词

引用

@article{arxiv.2605.05910,
  title  = {Plug-and-play Class-aware Knowledge Injection for Prompt Learning with Visual-Language Model},
  author = {Junhui Yin and Nan Pu and Xinyu Zhang and Lingfeng Yang and Lin Wu and Xiaojie Wang and Zhun Zhong},
  journal= {arXiv preprint arXiv:2605.05910},
  year   = {2026}
}

备注

Accepted by International Journal of Computer Vision