中文

TCP:基于文本的类感知提示微调用于视觉-语言模型

计算机视觉与模式识别 2024-03-14 v2

摘要

提示微调是一种将预训练视觉-语言模型(VLM)适配至各类下游任务的宝贵技术。近期基于 CoOp 的方法进展提出一组可学习的域共享或图像条件文本词元,以促成任务特定文本分类器的生成。然而,那些文本词元对未见域的泛化能力有限,因为它们无法针对测试类的分布动态调整。为解决此问题,我们提出一种新颖的基于文本的类感知提示微调(TCP),显式引入关于类别的先验知识以增强其可判别性。TCP 的关键理念在于利用文本知识嵌入(TKE)将类级文本知识的高泛化性映射为类感知文本词元。通过将这些类感知提示无缝整合进文本编码器,生成动态类感知分类器以提升对未见域的可判别性。推理期间,TKE 动态生成与未见类相关的类感知提示。综合评估表明,TKE 可作为即插即用模块轻松与现有方法结合。此外,TCP 在所需训练时间更少的同时持续取得更优性能。代码:https://github.com/htyao89/Textual-based_Class-aware_prompt_tuning/

关键词

引用

@article{arxiv.2311.18231,
  title  = {TCP:Textual-based Class-aware Prompt tuning for Visual-Language Model},
  author = {Hantao Yao and Rui Zhang and Changsheng Xu},
  journal= {arXiv preprint arXiv:2311.18231},
  year   = {2024}
}

备注

accepted by CVPR24