并非所有特征都重要:基于自适应先验精炼增强少样本 CLIP
计算机视觉与模式识别
2023-04-04 v1 人工智能
多媒体
摘要
对比语言-图像预训练(CLIP)的流行推动了其在多种下游视觉任务中的应用。为提升其在下游任务上的能力,少样本学习已成为被广泛采用的技术。然而,现有方法要么表现出有限性能,要么受制于过多的可学习参数。本文中,我们提出 APE,一种针对 CLIP 预训练知识的自适应先验精炼(Adaptive Prior rEfinement)方法,其以高计算效率实现了优越精度。通过先验精炼模块,我们分析下游数据中的类间差异,并将领域特定知识从 CLIP 提取的缓存模型中解耦。在此基础上,我们引入两种模型变体:免训练的 APE 与需训练的 APE-T。我们探索测试图像、先验缓存模型与文本表示之间的三边亲和性,仅启用一个轻量级类别残差模块进行训练。在 11 个基准上的平均精度方面,APE 与 APE-T 均达到最先进水平,并在 16 shot 下分别以少 30 倍的可学习参数超越次优方法 +1.59% 与 +1.99%。
引用
@article{arxiv.2304.01195,
title = {Not All Features Matter: Enhancing Few-shot CLIP with Adaptive Prior Refinement},
author = {Xiangyang Zhu and Renrui Zhang and Bowei He and Aojun Zhou and Dong Wang and Bin Zhao and Peng Gao},
journal= {arXiv preprint arXiv:2304.01195},
year = {2023}
}
备注
Code is available at https://github.com/yangyangyang127/APE