CLIPS:用于学习合成标题的增强CLIP框架
计算机视觉与模式识别
2024-11-27 v1
摘要
先前的研究表明,噪声较大的网络爬取图像-文本对可能限制视觉-语言预训练,如CLIP,因而提出使用合成标题进行学习作为一个有前景的替代方案。我们的工作延续了这一努力,引入两种简单而有效的设计,以更好地利用丰富描述的合成标题。首先,观察到在使用合成标题学习时存在强烈的反向效应——即短合成标题通常会导致远高于完整长度标题的性能,因此我们仅将部分合成标题输入文本编码器。其次,我们引入一个自回归标题生成器来模拟重新标定过程——通过以配对图像输入和网络爬取文本描述为条件,标题生成器学习预测由高级多模态大语言模型生成的完整合成标题。实验表明,我们的框架在跨模态检索任务中显著提升了零样本性能,在MSCOCO和Flickr30K上均取得了新的SOTA结果。此外,经过训练的视觉编码器可以增强LLaVA的视觉能力,在各种多模态大语言模型基准测试中表现出强大的改进。我们的项目页面为https://ucsc-vlaa.github.io/CLIPS/。
引用
@article{arxiv.2411.16828,
title = {CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions},
author = {Yanqing Liu and Xianhang Li and Zeyu Wang and Bingchen Zhao and Cihang Xie},
journal= {arXiv preprint arXiv:2411.16828},
year = {2024}
}
备注
12 pages