用GPT-4增强CLIP:利用视觉描述作为提示
计算机视觉与模式识别
2023-08-09 v2 人工智能
计算与语言
机器学习
摘要
像CLIP这样的对比预训练大型视觉-语言模型(VLM)通过在下游数据集上提供良好性能,革新了视觉表示学习。VLM通过设计与数据集相关的提示被零样本适配到下游数据集。此类提示工程利用了领域专业知识和验证数据集。同时,像GPT-4这样的生成式预训练模型的最新发展意味着它们可用作先进的互联网搜索工具。它们也可被操控以任何结构提供视觉信息。在本工作中,我们展示GPT-4可用于生成视觉描述性文本,以及这如何被用于适配CLIP到下游任务。与CLIP的默认提示相比,我们在专用细粒度数据集如EuroSAT(~7%)、DTD(~7%)、SUN397(~4.6%)和CUB(~3.3%)上展示了零样本迁移准确率的显著提升。我们还设计了一个简单的少样本适配器,学习选择最佳可能句子以构建可泛化分类器,其在平均上比最近提出的CoCoOP高出约2%,在4个专用细粒度数据集上高出超过4%。代码、提示和辅助文本数据集可在 https://github.com/mayug/VDT-Adapter 获取。
引用
@article{arxiv.2307.11661,
title = {Enhancing CLIP with GPT-4: Harnessing Visual Descriptions as Prompts},
author = {Mayug Maniparambil and Chris Vorster and Derek Molloy and Noel Murphy and Kevin McGuinness and Noel E. O'Connor},
journal= {arXiv preprint arXiv:2307.11661},
year = {2023}
}
备注
Paper accepted at ICCV-W 2023. V2 contains additional comparisons with concurrent works