中文

语义组合提升视觉语言对比学习

计算与语言 2024-12-19 v3 人工智能

摘要

在视觉语言对比学习领域,诸如CLIP之类的模型将匹配的图像-标题对作为正例,利用批内不匹配的对作为负例。这种方法在零样本图像分类、跨模态检索和线性评估任务中取得了显著成果。我们表明,通过在预训练期间引入语义组合示例,可显著提高CLIP类模型的零样本分类和检索能力。灵感来自视觉分类中的CutMix,我们通过一种新颖的程序创建语义组合图像-标题对,将两个不同实例的元素合并。该方法将标题合并,并将每张图像的50%混合以形成新的组合样本。这种简单技术(称为CLIP-C,即CLIP Compositions),不引入额外的计算开销或模型参数的增加,显著提高了零样本图像分类和跨模态检索。CLIP-C的优势在预训练数据相对有限的情景下尤为显著。

关键词

引用

@article{arxiv.2407.01406,
  title  = {Adapting Multilingual LLMs to Low-Resource Languages with Knowledge Graphs via Adapters},
  author = {Daniil Gurgurov and Mareike Hartmann and Simon Ostermann},
  journal= {arXiv preprint arXiv:2407.01406},
  year   = {2024}
}

备注

9 pages, KaLLM workshop