Meta-Adapter:一种面向视觉-语言模型的在线少样本学习器
计算机视觉与模式识别
2024-01-12 v2
摘要
被称为 CLIP 的对比视觉-语言预训练在感知开放世界视觉概念方面展现出显著潜力,可实现有效的零样本图像识别。然而,基于 CLIP 的少样本学习方法通常需要在少样本上离线微调参数,导致推理时间更长且在某些领域存在过拟合风险。为应对这些挑战,我们提出 Meta-Adapter,一种轻量级残差式适配器,以在线方式在少样本引导下精炼 CLIP 特征。借助少量训练样本,我们的方法可实现有效的少样本学习能力,并泛化至未见过的数据或任务而无需额外微调,取得具竞争力的性能与高效率。不加任何修饰,我们的方法在八个图像分类数据集上以更高推理速度平均超越最先进在线少样本学习方法 3.6%。此外,我们的模型简单灵活,作为即插即用模块可直接应用于下游任务。无需进一步微调,Meta-Adapter 在开放词汇目标检测与分割任务中获得了显著提升。
引用
@article{arxiv.2311.03774,
title = {Meta-Adapter: An Online Few-shot Learner for Vision-Language Model},
author = {Cheng Cheng and Lin Song and Ruoyi Xue and Hang Wang and Hongbin Sun and Yixiao Ge and Ying Shan},
journal= {arXiv preprint arXiv:2311.03774},
year = {2024}
}
备注
Accepted by NeurIPS 2023