AMU-Tuning:面向CLIP小样本学习的有效Logit偏置方法
计算机视觉与模式识别
2024-04-16 v1 计算与语言
机器学习
摘要
近年来,预训练的视觉-语言模型(如CLIP)在小样本学习中展现出巨大潜力,吸引了大量研究关注。尽管已有诸多努力致力于提升CLIP的小样本能力,但现有方法有效性的关键因素尚未得到充分研究,限制了CLIP在小样本学习中潜力的进一步探索。本文首先引入一个统一公式,从logit偏置的角度分析基于CLIP的小样本学习方法,这促使我们学习一个有效的logit偏置,以进一步提升基于CLIP的小样本学习方法的性能。为此,我们拆解了logit偏置计算中涉及的三个关键组成部分(即logit特征、logit预测器和logit融合),并实证分析了它们对小样本分类性能的影响。基于对关键组成部分的分析,本文提出了一种新颖的AMU-Tuning方法,为基于CLIP的小样本分类学习有效的logit偏置。具体而言,我们的AMU-Tuning通过利用合适的辅助(Auxiliary)特征来预测logit偏置,这些特征被输入到一个具有多分支(Multi-branch)训练的高效特征初始化线性分类器中。最后,开发了一种基于不确定性(Uncertainty)的融合方法,将logit偏置整合到CLIP中以进行小样本分类。在多个广泛使用的基准数据集上进行了实验,结果表明AMU-Tuning明显优于同类方法,在不增加额外复杂技巧的情况下,达到了基于CLIP的小样本学习的最先进性能。
引用
@article{arxiv.2404.08958,
title = {AMU-Tuning: Effective Logit Bias for CLIP-based Few-shot Learning},
author = {Yuwei Tang and Zhenyi Lin and Qilong Wang and Pengfei Zhu and Qinghua Hu},
journal= {arXiv preprint arXiv:2404.08958},
year = {2024}
}
备注
Accepted by CVPR 2024