中文

重新思考低样本 CLIP 适应中的视觉内容细化

计算机视觉与模式识别 2024-07-22 v1

摘要

最近的适应方法可以通过有效促进知识传递来提升对比式视觉语言预训练(CLIP)的低样本能力。然而,这些适应方法通常在输入图像的全局视角上操作,导致对局部细节的感知偏差。为解决此问题,我们在测试阶段的适应计算之前提出了视觉内容细化(VCR)。具体而言,我们首先将测试图像分解为不同尺度,以转移特征提取器的注意力到图像的细节上。然后,我们选择每个尺度中具有最大预测边际的图像视角,以过滤掉噪声图像视角,其中预测边际来自预训练的 CLIP 模型。最后,我们根据这些选定图像视角的尺度将其内容合并,以构建新的稳健表示。因此,合并后的内容可以直接用于帮助适配器关注全局和局部分析,而无需任何额外的训练参数。我们将方法应用于 3 个流行的低样本基准任务中的 13 个数据集,并在 state-of-the-art 方法上实现显著改进。例如,与基线(Tip-Adapter)在 few-shot 分类任务上的比较结果显示,我们的方法在训练-free 和 training-need 设置下平均提升约 2%。

关键词

引用

@article{arxiv.2407.14117,
  title  = {Rethinking Visual Content Refinement in Low-Shot CLIP Adaptation},
  author = {Jinda Lu and Shuo Wang and Yanbin Hao and Haifeng Liu and Xiang Wang and Meng Wang},
  journal= {arXiv preprint arXiv:2407.14117},
  year   = {2024}
}