中文

基于冻结视觉 - 语言模型的测试时视觉识别上下文提示学习

计算机视觉与模式识别 2024-08-20 v2

摘要

当前的预训练视觉 - 语言模型(如 CLIP)在各种下游任务中展示了卓越的零样本泛化能力。然而,当测试输入呈现不同分布时,其性能会显著下降。在本文中,我们探讨了测试时提示调优(TTPT)的概念,它通过仅涉及测试样本的单步无监督优化,促进 CLIP 模型适应新的下游任务。受自然语言处理(NLP)中上下文学习的启发,我们提出了用于测试时视觉识别任务的上下文提示学习(InCPL),该方法赋予预训练视觉 - 语言模型利用标记示例作为下游任务上下文信息的能力。具体而言,InCPL 将新的测试样本与极少量的标记示例(有时仅一个)关联起来作为上下文信息,从而实现可靠的测试样本标签估计并促进模型适应。为此,InCPL 采用了一种高效的语言到视觉转换器,以挖掘用于视觉提示学习的文本先验信息。此外,我们引入了一种上下文感知无监督损失,以优化针对测试样本定制的视觉提示。最后,我们设计了一种用于视觉和文本提示的循环学习策略,以确保不同模态之间的相互协同。这使得预训练的冻结 CLIP 模型能够利用其学习到的自适应提示适应任何任务。我们的方法展示了卓越的性能,并在各种下游数据集上实现了 state-of-the-art(最先进)的结果。

关键词

引用

@article{arxiv.2403.06126,
  title  = {In-context Prompt Learning for Test-time Vision Recognition with Frozen Vision-language Model},
  author = {Junhui Yin and Xinyu Zhang and Lin Wu and Xiaojie Wang},
  journal= {arXiv preprint arXiv:2403.06126},
  year   = {2024}
}