FLIER:基于潜在表示嵌入的少样本语言图像模型
计算机视觉与模式识别
2024-10-11 v1
摘要
随着大型视觉语言模型如对比式语言-图像预训练(CLIP)的快速发展,许多基于CLIP的方法在视觉识别任务中展现出惊人的能力,尤其在稀疏数据场景中效果更为突出。然而,我们注意到大多数方法仅限于对文本和图像编码器进行新的修改。最近,潜在扩散模型(LDMs)在图像生成方面表现出良好的能力。LDMs的强大能力使我们关注由UNet采样的潜在表示。灵感来自CoOp中提出的学习提示编码图像意义超出现有词汇的观点,我们假设对于深度模型,潜在表示是对图像的简洁且准确的理解,高频、难以察觉的细节被抽象化。在本文中,我们提出了一种基于潜在表示嵌入的少样本语言图像模型(FLIER),用于图像识别,通过引入一个与CLIP图像编码器联合训练的潜在编码器,它整合了CLIP的预训练视觉语言知识以及来自稳定扩散的潜在表示。我们首先通过稳定扩散生成图像及其对应的潜在表示,利用来自GPT-3的文本输入。将潜在表示作为“模型可理解的像素”,我们引入一个具有两个卷积层的灵活卷积神经网络作为潜在编码器,该编码器在视觉语言模型中通常更为简单。潜在编码器与CLIP图像编码器联合训练,更好地将预训练知识传递到下游任务。在各种视觉分类任务上的实验和大量消融研究表明,FLIER在11个数据集上进行的大多数少样本分类任务中实现了最先进的性能。
引用
@article{arxiv.2410.07648,
title = {FLIER: Few-shot Language Image Models Embedded with Latent Representations},
author = {Zhinuo Zhou and Peng Zhou and Xiaoyong Pan},
journal= {arXiv preprint arXiv:2410.07648},
year = {2024}
}
备注
8 pages,3 figures