提示大型预训练视觉-语言模型进行组合概念学习
计算机视觉与模式识别
2022-11-10 v1
摘要
本工作探索了大型预训练视觉-语言模型(VLMs)在基于提示的学习框架下的零样本组合学习能力,并提出了一种模型(PromptCompVL)来解决组合零样本学习(CZSL)问题。PromptCompVL 做出了两点设计选择:首先,它使用软提示(soft-prompting)而非硬提示(hard-prompting)来注入可学习参数以重编程 VLM 进行组合学习;其次,为应对组合挑战,它使用软嵌入层来学习不同组合中的基元概念。通过结合软嵌入与软提示,PromptCompVL 在 MIT-States 数据集上取得了最先进的性能。此外,与其他基于 CLIP 的方法相比,我们所提出的模型取得了持续的改进,这表明所提出的提示策略对于 CZSL 的有效性。
引用
@article{arxiv.2211.05077,
title = {Prompting Large Pre-trained Vision-Language Models For Compositional Concept Learning},
author = {Guangyue Xu and Parisa Kordjamshidi and Joyce Chai},
journal= {arXiv preprint arXiv:2211.05077},
year = {2022}
}