中文

Long-CLIP:解锁 CLIP 的长文本能力

计算机视觉与模式识别 2024-07-23 v3

摘要

对比语言-图像预训练(CLIP)通过对齐图像和文本模态,已成为零样本分类、文本-图像检索和文本-图像生成的基石。尽管被广泛采用,CLIP 的一个显著限制在于文本输入长度不足。文本 token 的长度被限制为 77,并且一项实证研究表明实际有效长度甚至小于 20。这阻止了 CLIP 处理详细描述,限制了其在具有广泛前提条件的图像检索和文本到图像生成中的应用。为此,我们提出 Long-CLIP 作为 CLIP 的即插即用替代方案,它支持长文本输入,保持甚至超越其零样本泛化能力,并对齐 CLIP 潜在空间,使其无需在下游框架中进行任何进一步适配即可轻松替换 CLIP。然而,实现这一目标远非易事,因为简单的微调可能导致 CLIP 性能显著下降。此外,用支持更长上下文的语言模型替换文本编码器需要使用大量数据进行预训练,从而产生巨大开销。因此,Long-CLIP 在 CLIP 上引入了一种高效的微调解决方案,采用两种旨在保持原始能力的新颖策略,包括(1)知识保留的位置嵌入拉伸和(2)CLIP 特征的主成分匹配。仅利用一百万额外的长文本-图像对,Long-CLIP 在长字幕文本-图像检索中比 CLIP 显示出约 20% 的优越性,在传统文本-图像检索任务(如 COCO 和 Flickr30k)中显示出 6% 的优越性。此外,Long-CLIP 通过以即插即用的方式替换 CLIP,提供了从详细文本描述生成图像的增强能力。

关键词

引用

@article{arxiv.2403.15378,
  title  = {Long-CLIP: Unlocking the Long-Text Capability of CLIP},
  author = {Beichen Zhang and Pan Zhang and Xiaoyi Dong and Yuhang Zang and Jiaqi Wang},
  journal= {arXiv preprint arXiv:2403.15378},
  year   = {2024}
}

备注

ECCV 2024. All codes and models are publicly available at https://github.com/beichenzbc/Long-CLIP