中文

AAPL:为视觉-语言模型的提示学习添加属性

计算机视觉与模式识别 2024-04-26 v1 人工智能 机器学习

摘要

大型预训练视觉-语言模型的最新进展在零样本下游任务中展现出了卓越的性能。在此基础上,最近的研究(如 CoOp 和 CoCoOp)提出了使用提示学习,将提示中的上下文替换为可学习向量,从而比手工制作的提示取得了显著改进。然而,对未见类的性能提升仍然微乎其微,为了解决这个问题,传统零样本学习技术中经常使用数据增强。通过我们的实验,我们发现了 CoOp 和 CoCoOp 中的一个重要问题:通过传统图像增强学习到的上下文偏向于已见类,对向未见类的泛化产生负面影响。为了解决这个问题,我们提出了对抗性 token 嵌入,以在可学习提示中引入偏差时将低级视觉增强特征与高级类信息解耦。通过我们称为“为提示学习添加属性”(AAPL)的新颖机制,我们引导可学习上下文通过关注未见类的高级特征来有效提取文本特征。我们在 11 个数据集上进行了实验,总体而言,AAPL 在少样本学习、零样本学习、跨数据集和领域泛化任务中相比现有方法表现出良好的性能。

关键词

引用

@article{arxiv.2404.16804,
  title  = {AAPL: Adding Attributes to Prompt Learning for Vision-Language Models},
  author = {Gahyeon Kim and Sohee Kim and Seokju Lee},
  journal= {arXiv preprint arXiv:2404.16804},
  year   = {2024}
}

备注

Accepted to CVPR 2024 Workshop on Prompting in Vision, Project Page: https://github.com/Gahyeonkim09/AAPL