提示、生成然后缓存:基础模型级联造就强少样本学习器
计算机视觉与模式识别
2023-03-06 v1 计算与语言
摘要
低数据环境下的视觉识别需要深度神经网络从有限训练样本中学习泛化表征。近来,基于 CLIP 的方法凭借对比语言-图像预训练展现出有前景的少样本性能。我们进而质疑,若能将更多样的预训练知识级联起来,能否进一步辅助少样本表征学习。本文中,我们提出 CaFo,一种基础模型级联(Cascade of Foundation models),它融合多种预训练范式的多样先验知识以实现更好的少样本学习。我们的 CaFo 融合了 CLIP 的语言-对比知识、DINO 的视觉-对比知识、DALL-E 的视觉-生成知识,以及 GPT-3 的语言-生成知识。具体而言,CaFo 以“提示、生成然后缓存”方式工作。首先,我们利用 GPT-3 生成文本输入,以丰富的下游语言语义提示 CLIP。随后,我们通过 DALL-E 生成合成图像,在无需任何人力的情况下扩充少样本训练数据。最后,我们引入可学习的缓存模型,自适应地融合来自 CLIP 与 DINO 的预测。通过此种协作,CaFo 能充分释放不同预训练方法的潜力,并将其统一以在少样本分类上取得最先进(state-of-the-art)性能。代码见 https://github.com/ZrrSkywalker/CaFo。
引用
@article{arxiv.2303.02151,
title = {Prompt, Generate, then Cache: Cascade of Foundation Models makes Strong Few-shot Learners},
author = {Renrui Zhang and Xiangfei Hu and Bohao Li and Siyuan Huang and Hanqiu Deng and Hongsheng Li and Yu Qiao and Peng Gao},
journal= {arXiv preprint arXiv:2303.02151},
year = {2023}
}
备注
Accepted by CVPR 2023. Code is available at https://github.com/ZrrSkywalker/CaFo. arXiv admin note: substantial text overlap with arXiv:2209.12255