中文

仅使用文本监督学习为视觉语言模型生成提示

计算机视觉与模式识别 2024-01-05 v1

摘要

基础视觉语言模型(如CLIP)因其出色的泛化能力正在成为视觉领域的新范式。然而,在保持其泛化能力的同时将这些模型适应下游任务仍然是一个挑战。在文献中,一类方法通过使用视觉信息学习提示来适应CLIP。虽然有效,但这些方法大多需要标记数据,这并不实用,并且由于在源数据上过拟合,通常难以泛化到新数据集。另一种方法诉诸于无训练方法,通过从大型语言模型(LLM)生成类描述并执行提示集成。然而,这些方法通常生成特定于类的提示,无法转移到其他类,这导致为每个类单独生成LLM描述的成本更高。在这项工作中,我们提出通过仅使用从LLM派生的文本数据来学习提示,从而结合这两类方法的优势。由于缺乏图像,提示的监督训练并非易事,因此我们开发了一种训练方法,允许提示从LLM数据中提取丰富的上下文知识。此外,通过将LLM上下文数据映射到学习到的提示中,它实现了提示到新类别和数据集的零样本迁移,可能降低LLM提示工程成本。据我们所知,这是第一个仅使用文本数据学习通用提示的工作。我们在4个基准上进行了广泛评估,我们的方法改进了先前的集成工作,同时与那些使用标记图像的方法具有竞争力。我们的代码和预训练模型可在https://github.com/muzairkhattak/ProText 获取。

关键词

引用

@article{arxiv.2401.02418,
  title  = {Learning to Prompt with Text Only Supervision for Vision-Language Models},
  author = {Muhammad Uzair Khattak and Muhammad Ferjad Naeem and Muzammal Naseer and Luc Van Gool and Federico Tombari},
  journal= {arXiv preprint arXiv:2401.02418},
  year   = {2024}
}

备注

Project Page: https://muzairkhattak.github.io/ProText/