中文

DreamLIP:带有长描述的语言-图像预训练

计算机视觉与模式识别 2024-03-26 v1

摘要

语言-图像预训练在很大程度上依赖于文本对其配对图像描述的精确性和全面性。然而在实践中,图像内容可能非常丰富,以至于很好地描述它们需要长描述(例如,10个句子),而这在现有数据集中通常是缺失的。因此,目前没有明确的证据表明语言-图像预训练是否以及如何能从长描述中受益。为了弄清这一点,我们首先使用预训练的多模态大语言模型(MLLM)对 30M 图像进行重新描述以提供详细描述,然后在对比学习框架下研究所得描述的使用。我们观察到,长描述中的每个句子很可能只描述图像的一部分(例如,一个物体)。受此启发,我们提出从文本标签中动态采样子描述以构建多个正样本对,并引入分组损失,以自监督方式将每个子描述的嵌入与其对应的局部图像 patch 进行匹配。在广泛下游任务上的实验结果证明了我们方法(称为 DreamLIP)相对于以往方法的持续优越性,突出了其细粒度的表示能力。值得注意的是,在图像-文本检索和语义分割任务上,我们使用 30M 图像-文本对训练的模型达到了与使用 400M 对训练的 CLIP 相当甚至更好的性能。项目页面可在 https://zyf0619sjtu.github.io/dream-lip 获取。

关键词

引用

@article{arxiv.2403.17007,
  title  = {DreamLIP: Language-Image Pre-training with Long Captions},
  author = {Kecheng Zheng and Yifei Zhang and Wei Wu and Fan Lu and Shuailei Ma and Xin Jin and Wei Chen and Yujun Shen},
  journal= {arXiv preprint arXiv:2403.17007},
  year   = {2024}
}