一个难以超越的无训练 CLIP 适配基线
计算机视觉与模式识别
2024-02-07 v1 人工智能
机器学习
摘要
对比语言-图像预训练(CLIP)因其卓越的零样本能力而广受欢迎。最近的研究集中在开发高效的微调方法(如 prompt learning 和 adapter),以提升 CLIP 在下游任务中的性能。然而,这些方法仍需要额外的训练时间和计算资源,这对于资源受限的设备是不理想的。在本文中,我们重新审视了一种经典算法——高斯判别分析(GDA),并将其应用于 CLIP 的下游分类。通常,GDA 假设每个类别的特征遵循具有相同协方差的高斯分布。通过利用贝叶斯公式,分类器可以用类均值和协方差来表示,这些参数可以直接从数据中估计而无需训练。为了整合来自视觉和文本模态的知识,我们将其与 CLIP 中原始的零样本分类器进行集成。在 17 个数据集上的广泛结果验证了我们的方法在少样本分类、不平衡学习和分布外泛化方面超越或达到了与 state-of-the-art 方法相当的结果。此外,我们将方法扩展到 base-to-new 泛化和无监督学习,再次展示了其相对于竞争方法的优越性。我们的代码已在 \url{https://github.com/mrflogs/ICLR24} 公开。
引用
@article{arxiv.2402.04087,
title = {A Hard-to-Beat Baseline for Training-free CLIP-based Adaptation},
author = {Zhengbo Wang and Jian Liang and Lijun Sheng and Ran He and Zilei Wang and Tieniu Tan},
journal= {arXiv preprint arXiv:2402.04087},
year = {2024}
}
备注
Accepted by ICLR 2024