图像描述增强的 CLIP-适配器:IDEA
计算机视觉与模式识别
2025-01-22 v2 人工智能
机器学习
摘要
CLIP(Contrastive Language-Image Pre-training)在模式识别和计算机视觉中取得了巨大成功。将 CLIP 迁移到下游任务(如零样本或少样本分类)是多模态学习中的热门话题。然而,当前研究主要关注文本的提示学习或视觉的适配器调优,未充分利用图像-文本对之间的互补信息和相关性。本文提出了图像描述增强的 CLIP-适配器(Image Description Enhanced CLIP-Adapter, IDEA)方法,用于适配 CLIP 以适应少样本图像分类任务。该方法通过利用视觉特征和图像的文本描述来捕获细粒度特征。IDEA 是一种无需训练的 CLIP 方法,可与甚至超过多个任务中最先进的模型相当。此外,我们引入了可训练的 IDEA(T-IDEA),通过添加两个轻量级可学习组件(即投影器和可学习的潜在空间)进一步提升模型性能,在 11 个数据集上实现了最先进的结果。作为重要贡献之一,我们采用 Llama 模型并设计了完整的管道来生成 11 个数据集图像的文本描述,总计达1637795 张图像-文本对,命名为“IMD-11”。我们的代码和数据已发布于 https://github.com/FourierAI/IDEA。
引用
@article{arxiv.2501.08816,
title = {IDEA: Image Description Enhanced CLIP-Adapter},
author = {Zhipeng Ye and Feng Jiang and Qiufeng Wang and Kaizhu Huang and Jiaqi Huang},
journal= {arXiv preprint arXiv:2501.08816},
year = {2025}
}