中文

CLIPS:用于学习合成标题的增强CLIP框架

计算机视觉与模式识别 2024-11-27 v1

摘要

先前的研究表明,噪声较大的网络爬取图像-文本对可能限制视觉-语言预训练,如CLIP,因而提出使用合成标题进行学习作为一个有前景的替代方案。我们的工作延续了这一努力,引入两种简单而有效的设计,以更好地利用丰富描述的合成标题。首先,观察到在使用合成标题学习时存在强烈的反向效应——即短合成标题通常会导致远高于完整长度标题的性能,因此我们仅将部分合成标题输入文本编码器。其次,我们引入一个自回归标题生成器来模拟重新标定过程——通过以配对图像输入和网络爬取文本描述为条件,标题生成器学习预测由高级多模态大语言模型生成的完整合成标题。实验表明,我们的框架在跨模态检索任务中显著提升了零样本性能,在MSCOCO和Flickr30K上均取得了新的SOTA结果。此外,经过训练的视觉编码器可以增强LLaVA的视觉能力,在各种多模态大语言模型基准测试中表现出强大的改进。我们的项目页面为https://ucsc-vlaa.github.io/CLIPS/。

关键词

引用

@article{arxiv.2411.16828,
  title  = {CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions},
  author = {Yanqing Liu and Xianhang Li and Zeyu Wang and Bingchen Zhao and Cihang Xie},
  journal= {arXiv preprint arXiv:2411.16828},
  year   = {2024}
}

备注

12 pages