GIST:为细粒度物体分类生成图像特定文本
计算机视觉与模式识别
2023-08-08 v2 计算与语言
摘要
近期的视觉-语言模型在许多图像分类任务上优于仅视觉模型。然而,由于缺乏配对的文本/图像描述,对这些模型进行细粒度图像分类的微调仍然困难。本工作中,我们提出一种方法GIST,用于从仅图像数据集中生成图像特定的细粒度文本描述,并表明这些文本描述可用于改进分类。我们方法的关键部分包括:1. 用领域特定提示(prompt)引导预训练大语言模型,为每一类生成多样的细粒度文本描述;2. 使用预训练视觉-语言模型将每张图像匹配到保留标签的文本描述,这些描述捕捉图像中相关的视觉特征。我们通过对图像与生成文本对微调视觉-语言模型来学习对齐的视觉-语言表示空间以改进分类,从而展示GIST的效用。我们在来自不同领域的四个多样细粒度分类数据集上,以全样本与少样本场景评估所学表示空间。我们的方法在准确率上较CLIP线性探针平均提升,较先前最优的图像-文本分类方法在全样本数据集上平均提升。我们的方法在少样本设定下取得类似提升。代码见 https://github.com/emu1729/GIST。
引用
@article{arxiv.2307.11315,
title = {GIST: Generating Image-Specific Text for Fine-grained Object Classification},
author = {Kathleen M. Lewis and Emily Mu and Adrian V. Dalca and John Guttag},
journal= {arXiv preprint arXiv:2307.11315},
year = {2023}
}
备注
The first two authors contributed equally to this work and are listed in alphabetical order