中文

CLIP 视野不够广:关注句子之外的注意力

计算机视觉与模式识别 2026-03-31 v2

摘要

CLIP 模型通过在互联网规模数据上的图像-文本对比学习来学习可迁移的多模态特征。它们在零样态分类、多模态检索、文本到图像扩散以及作为大型视觉语言模型中的图像编码器方面得到广泛应用。然而,CLIP 的预训练主要由与短标题配对的图像驱动,这导致模型倾向于编码显著物体的简单描述,进而在复杂场景和密集描述上实现粗糙的对齐。虽然最近的工作通过在小规模长标题数据集上微调来缓解这一问题,但我们识别出一种重要的常见偏差:人类生成和大语言模型生成的长标题通常以一个概括句开头,随后是详细描述。我们展示了这一情况在训练期间充当捷径,集中注意力于开头句和早期标记,从而削弱了标题其余部分的对齐。为解决这一问题,我们提出了 DeBias-CLIP,该方法在训练时移除概括句,并应用句子子抽样和文本标记填充,将监督分布到所有标记位置。DeBias-CLIP 在长文本检索方面实现了最先进的性能,改进了短文本检索,并且对句子顺序置换不那么敏感。它是 Long-CLIP 的即插即用替换方案,不需要额外的可训练参数。

关键词

引用

@article{arxiv.2602.22419,
  title  = {CLIP Is Shortsighted: Paying Attention Beyond the First Sentence},
  author = {Marc-Antoine Lavoie and Anas Mahmoud and Aldo Zaimi and Arsene Fansi Tchango and Steven L. Waslander},
  journal= {arXiv preprint arXiv:2602.22419},
  year   = {2026}
}

备注

20 pages, 15 figures, to be published in the CVPR 2026 proceedings