LaFTer:利用语言与无标签图像集合对零样本分类器进行无标签调优
计算机视觉与模式识别
2023-10-24 v2 计算与语言
摘要
近来,大规模预训练的视觉与语言(VL)模型在零样本视觉分类中确立了新的最先进(SOTA)水平,能够开放词汇识别由简单语言提示定义的潜在无限类别集合。然而,尽管取得了这些重大进展,这些零样本分类器的性能仍落后于通过监督微调训练的专用(封闭类别集)分类器的结果。本文中我们首次展示如何在不使用任何标签且不使用任何配对 VL 数据的情况下缩小这一差距,利用无标签图像集合和一组由大语言模型(LLM)自动生成的文本,描述感兴趣的类别并有效替代这些类别的带标签视觉实例。使用我们的无标签方法,我们能够在多种数据集上获得相对于基础 VL 模型零样本性能及其他当代方法与基线的显著性能提升,在无标签设定下展示高达 11.7%(平均 3.8%)的绝对提升。此外,尽管我们的方法无标签,我们观察到相对于使用 5-shot 监督的领先少样本提示基线有平均 1.3% 的提升。
引用
@article{arxiv.2305.18287,
title = {LaFTer: Label-Free Tuning of Zero-shot Classifier using Language and Unlabeled Image Collections},
author = {M. Jehanzeb Mirza and Leonid Karlinsky and Wei Lin and Mateusz Kozinski and Horst Possegger and Rogerio Feris and Horst Bischof},
journal= {arXiv preprint arXiv:2305.18287},
year = {2023}
}
备注
NeurIPS 2023 (Camera Ready) - Project Page: https://jmiemirza.github.io/LaFTer/