中文

一种用于改进文本-图像模型提示集成的简单零样本提示加权技术

机器学习 2023-07-18 v2 计算机视觉与模式识别 机器学习

摘要

对比训练的文本-图像模型具有卓越的零样本分类能力,即能够将先前未见过的图像分类到模型从未被显式训练去识别的类别中。然而,这些零样本分类器需要提示工程才能达到高准确率。提示工程通常需为各个下游任务手工设计一组提示。在本工作中,我们旨在自动化此提示工程并通过提示集成提升零样本准确率。具体而言,我们提出这样的问题:“给定一个大型提示池,我们能否自动对提示打分,并集成那些最适合特定下游数据集的提示,而无需访问带标签的验证数据?”我们证明这是可行的。在此过程中,我们识别出朴素提示打分方法中的若干缺陷,即由于预训练和测试数据中的偏差,分数容易过度自信,并提出了一种修正这些偏差的新型提示打分方法。使用我们提出的打分方法创建加权平均提示集成,我们的方法在 ImageNet、其 4 个变体以及 11 个细粒度分类基准上优于等平均集成以及手工设计的提示,同时完全自动、无需优化且不需要访问带标签的验证数据。

关键词

引用

@article{arxiv.2302.06235,
  title  = {A Simple Zero-shot Prompt Weighting Technique to Improve Prompt Ensembling in Text-Image Models},
  author = {James Urquhart Allingham and Jie Ren and Michael W Dusenberry and Xiuye Gu and Yin Cui and Dustin Tran and Jeremiah Zhe Liu and Balaji Lakshminarayanan},
  journal= {arXiv preprint arXiv:2302.06235},
  year   = {2023}
}

备注

Accepted at ICML 2023. 23 pages, 10 tables, 3 figures