中文

IntCoOp:面向可解释性的视觉语言提示调优

计算机视觉与模式识别 2024-06-21 v1 人工智能

摘要

图像-文本对比模型如 CLIP 能学习可迁移且稳健的表征,用于零样本迁移到各种下游任务。然而,为获得强大的下游性能,提示词需要精心挑选,这是一项繁琐的工程任务。为解决手动提示工程的问题,采用提示调优方法,通过利用训练数据中的信息学习一组上下文向量。尽管这些方法有效,但现有的提示调优框架往往缺乏可解释性,限制了其理解图像组成性质的能力。本文首先指出,在手动提示设计中融合组成属性(例如“绿色”树蛙)可显著提升图像-文本对齐得分。基于此观察,我们提出了一种新颖且可解释的提示调优方法,称为 IntCoOp,它在提示调优期间学习联合对齐属性层归纳偏置和类别嵌入。为评估我们方法的有效性,我们在 few-shot 学习设置下对 IntCoOp 进行评估:针对新类别的泛化,以及未见域迁移。通过在 CLIP 上进行实验,我们在 10 个下游数据集上发现,引入属性层归纳偏置在状态机械提示调优框架中取得优异性能。值得注意的是,在 16-shot 设置下,IntCoOp 相比 CoOp 在 10 个多样化数据集上的平均性能提升了 7.35%。

关键词

引用

@article{arxiv.2406.13683,
  title  = {IntCoOp: Interpretability-Aware Vision-Language Prompt Tuning},
  author = {Soumya Suvra Ghosal and Samyadeep Basu and Soheil Feizi and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2406.13683},
  year   = {2024}
}