面向组合零样本学习的视觉自适应提示
计算机视觉与模式识别
2025-07-25 v6 机器学习
摘要
视觉语言模型(VLMs)在学习视觉和文本数据的联合表征方面展现了惊人的多模态能力,成为处理组合零样本学习(CZSL)等任务的强大工具。CZSL 需要模型对视觉原语(如属性和对象)的 novel 组合进行泛化,这些组合在训练期间未被显式遇到。近期在 CZSL 提示学习中,关注于修改文本编码器的输入,常使用跨不同视觉情境不变的静态提示。然而,这些方法难以充分捕捉变化的视觉情境,因为它们侧重于文本适应而非利用视觉特征进行组合推理。为此,我们提出了视觉自适应提示系统(VAPS),该系统利用可学习的视觉提示存储库和基于相似度的检索机制,在 VLMs 框架中搭建语义与视觉特征之间的鸿沟。我们的方法引入了动态视觉提示存储库机制,通过图像的视觉特征选择最相关的属性和对象提示。我们提出的系统包括一个视觉提示适配器,鼓励模型学习更具可泛化性的嵌入空间。在三个 CZSL 数据集上进行的实验,涵盖封闭世界和开放世界场景,均显示出状态的最佳结果。
引用
@article{arxiv.2502.20292,
title = {Visual Adaptive Prompting for Compositional Zero-Shot Learning},
author = {Kyle Stein and Arash Mahyari and Guillermo Francia and Eman El-Sheikh},
journal= {arXiv preprint arXiv:2502.20292},
year = {2025}
}