中文

大语言模型是低样本图像分类的优秀提示学习器

计算机视觉与模式识别 2024-04-04 v2

摘要

低样本图像分类(训练图像有限或不可获取)受益于预训练视觉-语言(VL)模型(如CLIP)的强泛化能力。基于VL模型构建的提示学习方法从类名生成文本特征,但这些类名仅包含有限的类特定信息。大语言模型(LLM)凭借其庞大的百科全书式知识,成为补充。因此,本文讨论了如何集成LLM以增强预训练VL模型,特别是在低样本分类上。然而,语言和视觉之间的领域差距阻碍了LLM的直接应用。因此,我们提出LLaMP(大语言模型作为提示学习器),它为CLIP文本编码器生成自适应提示,从而建立连接桥梁。实验表明,与其他最先进的提示学习方法相比,LLaMP在零样本泛化和少样本图像分类上,在11个数据集上均取得了更好的性能。代码将在 https://github.com/zhaohengz/LLaMP 提供。

关键词

引用

@article{arxiv.2312.04076,
  title  = {Large Language Models are Good Prompt Learners for Low-Shot Image Classification},
  author = {Zhaoheng Zheng and Jingmin Wei and Xuefeng Hu and Haidong Zhu and Ram Nevatia},
  journal= {arXiv preprint arXiv:2312.04076},
  year   = {2024}
}

备注

CVPR 2024