中文

Tip-Adapter:面向更优视觉-语言建模的免训练 CLIP-Adapter

计算机视觉与模式识别 2021-11-16 v2 计算与语言

摘要

被称为 CLIP 的对比视觉-语言预训练,通过使用大规模对比图像-文本对,为学习视觉表征提供了新范式。它在向下游任务的零样本知识迁移中展现出令人印象深刻的性能。为进一步增强 CLIP 的小样本能力,CLIP-Adapter 提出微调一个轻量级残差特征适配器,显著提升了小样本分类性能。然而,该过程仍需要额外的训练与计算资源。本文中,我们提出 \textbf{T}raining-Free CL\textbf{IP}-\textbf{Adapter}(\textbf{Tip-Adapter}),其不仅继承了 CLIP 免训练的优势,且表现与 CLIP-Adapter 相当甚至更优。Tip-Adapter 不需要任何反向传播来训练适配器,而是通过由小样本训练集构建的键值缓存模型来创建权重。在这种非参数方式下,Tip-Adapter 无需任何训练即获得性能良好的适配器权重,既高效又有效。此外,通过对这种恰当初始化的适配器仅微调少数几个轮次且以极快收敛速度,Tip-Adapter 的性能可进一步提升。我们在 ImageNet 及其他 10 个数据集上进行了广泛的小样本分类实验,以证明所提 Tip-Adapter 的优越性。代码将发布于 \url{https://github.com/gaopengcuhk/Tip-Adapter}。

关键词

引用

@article{arxiv.2111.03930,
  title  = {Tip-Adapter: Training-free CLIP-Adapter for Better Vision-Language Modeling},
  author = {Renrui Zhang and Rongyao Fang and Wei Zhang and Peng Gao and Kunchang Li and Jifeng Dai and Yu Qiao and Hongsheng Li},
  journal= {arXiv preprint arXiv:2111.03930},
  year   = {2021}
}

备注

preprints