中文

提示大型预训练视觉-语言模型进行组合概念学习

计算机视觉与模式识别 2022-11-10 v1

摘要

本工作探索了大型预训练视觉-语言模型(VLMs)在基于提示的学习框架下的零样本组合学习能力,并提出了一种模型(PromptCompVL)来解决组合零样本学习(CZSL)问题。PromptCompVL 做出了两点设计选择:首先,它使用软提示(soft-prompting)而非硬提示(hard-prompting)来注入可学习参数以重编程 VLM 进行组合学习;其次,为应对组合挑战,它使用软嵌入层来学习不同组合中的基元概念。通过结合软嵌入与软提示,PromptCompVL 在 MIT-States 数据集上取得了最先进的性能。此外,与其他基于 CLIP 的方法相比,我们所提出的模型取得了持续的改进,这表明所提出的提示策略对于 CZSL 的有效性。

关键词

引用

@article{arxiv.2211.05077,
  title  = {Prompting Large Pre-trained Vision-Language Models For Compositional Concept Learning},
  author = {Guangyue Xu and Parisa Kordjamshidi and Joyce Chai},
  journal= {arXiv preprint arXiv:2211.05077},
  year   = {2022}
}