中文

GIPCOL:用于组合零样本学习的图注入软提示

计算机视觉与模式识别 2023-11-13 v1

摘要

预训练视觉-语言模型(VLMs)已在诸多领域取得可喜成功,尤其在提示学习范式下。本工作中,我们提出GIPCOL(用于组合学习的图注入软提示,Graph-Injected Soft Prompting for COmpositional Learning),以在基于提示的学习框架内更好地挖掘VLMs的组合零样本学习(CZSL)能力。GIPCOL中的软提示是结构化的,由前缀可学习向量、属性标签和对象标签组成。此外,软提示中的属性与对象标签被指定为组合图中的节点。该组合图基于从训练数据提取的对象与属性组合结构构建,进而将更新后的概念表示馈入软提示,以捕捉该组合结构从而实现更好的CZSL提示。借助新提示策略,GIPCOL在三个CZSL基准(包括MIT-States、UT-Zappos和C-GQA数据集)的封闭与开放设定下,相较以往非CLIP及基于CLIP的方法均取得了最先进的AUC结果。我们分析了在以CLIP为骨干及训练数据局限下GIPCOL何时以及为何表现良好,我们的发现为设计更有效的CZSL提示提供了启示。

关键词

引用

@article{arxiv.2311.05729,
  title  = {GIPCOL: Graph-Injected Soft Prompting for Compositional Zero-Shot Learning},
  author = {Guangyue Xu and Joyce Chai and Parisa Kordjamshidi},
  journal= {arXiv preprint arXiv:2311.05729},
  year   = {2023}
}

备注

WACV24