中文

聚合-调整自然语言提示以提升 CLIP 的下游泛化能力

机器学习 2024-11-01 v1 计算机视觉与模式识别

摘要

大型预训练视觉语言模型如 CLIP 已显示出良好的泛化能力,但在 specialized domains(例如卫星图像)或 fine-grained classification(例如汽车型号)等受限于预训练中未见或欠表示的视觉概念时可能难以胜任。在这种情况下,提示学习提供了一种参数高效的微调框架,可即使在有限标注数据可用的情况下也能适应 CLIP 以适应下游任务。本文通过从自然语言提示(无论是人类生成的还是 LLM 生成的)中蒸馏文本知识,以为这些欠表示概念提供丰富的先验条件。我们首先通过学习的提示聚合器获取与每个输入图像对齐的提示“摘要”。随后我们联合训练一个提示生成器,优化其以产生与聚合摘要接近的提示嵌入,同时最小化任务损失。我们将此类提示嵌入称为聚合-调整提示嵌入(AAPE)。实验表明,AAPE 能够泛化到不同下游数据分布和任务,包括视觉语言理解任务(如 few-shot classification、VQA)和生成任务(图像字幕),其中 AAPE 实现了具竞争力的性能。我们还表明 AAPE 对处理 non-canonical 和 OOD 示例特别有帮助。此外,AAPE 学习消除了基线所需的 LLM 推理成本,并且在数据规模和 LLM 模型大小方面表现更佳。

关键词

引用

@article{arxiv.2410.23698,
  title  = {Aggregate-and-Adapt Natural Language Prompts for Downstream Generalization of CLIP},
  author = {Chen Huang and Skyler Seto and Samira Abnar and David Grangier and Navdeep Jaitly and Josh Susskind},
  journal= {arXiv preprint arXiv:2410.23698},
  year   = {2024}
}

备注

NeurIPS 2024