中文

Tip-Adapter:面向少样本分类的CLIP免训练适配方法

计算机视觉与模式识别 2022-07-21 v1 人工智能 计算与语言

摘要

被称为CLIP的对比视觉-语言预训练,利用大规模图像-文本对为学习视觉表征提供了新范式。其通过零样本知识迁移在下游任务上展现出令人印象深刻的性能。为进一步增强CLIP的适配能力,现有方法提出微调额外的可学习模块,虽显著提升了少样本性能,却引入了额外的训练时间与计算资源。本文中,我们提出一种用于CLIP进行少样本分类的免训练适配方法,称为Tip-Adapter,其不仅继承了零样本CLIP的免训练优势,且性能可与那些需训练的方法相媲美。Tip-Adapter通过少样本训练集的键值缓存模型构建适配器,并借助特征检索更新CLIP中编码的先验知识。在此基础上,通过对缓存模型以比现有方法少10×\times的轮数微调,Tip-Adapter的性能可进一步提升至ImageNet上的最先进水平,既有效又高效。我们在11个数据集上进行了广泛的少样本分类实验以证明所提方法的优越性。代码发布于 https://github.com/gaopengcuhk/Tip-Adapter。

关键词

引用

@article{arxiv.2207.09519,
  title  = {Tip-Adapter: Training-free Adaption of CLIP for Few-shot Classification},
  author = {Renrui Zhang and Zhang Wei and Rongyao Fang and Peng Gao and Kunchang Li and Jifeng Dai and Yu Qiao and Hongsheng Li},
  journal= {arXiv preprint arXiv:2207.09519},
  year   = {2022}
}

备注

Accepted by ECCV 2022. arXiv admin note: substantial text overlap with arXiv:2111.03930