利用合成提示改善CLIP的零样本泛化能力
计算机视觉与模式识别
2023-07-17 v1 机器学习
摘要
随着对CLIP等预训练视觉-语言模型兴趣的增长,近期研究聚焦于将这些模型适配到下游任务。尽管取得了有前景的结果,大多数现有方法要求所有类别均有标注数据,而由于长尾与齐夫定律(Zipf's law),这在真实应用中可能不成立。例如,某些类别可能完全缺乏标注数据,如新兴概念。为解决此问题,我们提出一种即插即用的生成式方法,称为合成提示(SyntHesIzed Prompts, SHIP),以改善现有微调方法。具体而言,我们遵循变分自编码器,引入一个生成器,通过将合成提示与相应类名输入CLIP的文本编码器来重建视觉特征。以此方式,我们轻松获得剩余仅含标签类别的合成特征。此后,我们将标注特征与合成特征结合,通过现成方法微调CLIP。在基到新泛化、跨数据集迁移学习与广义零样本学习上的大量实验证明了我们方法的优越性。代码见 https://github.com/mrflogs/SHIP。
引用
@article{arxiv.2307.07397,
title = {Improving Zero-Shot Generalization for CLIP with Synthesized Prompts},
author = {Zhengbo Wang and Jian Liang and Ran He and Nan Xu and Zilei Wang and Tieniu Tan},
journal= {arXiv preprint arXiv:2307.07397},
year = {2023}
}
备注
Accepted by ICCV 2023