中文

鹦鹉式标题教导 CLIP 识别文本

计算机视觉与模式识别 2024-02-02 v3 人工智能

摘要

尽管 CLIP 是众多视觉 - 语言应用的基础模型,但 CLIP 存在严重的文本识别偏差。这种偏差导致 CLIP 模型“鹦鹉学舌”般地复述图像中嵌入的视觉文本,而忽视真实的视觉语义。我们发现在最流行的图像 - 文本数据集 LAION-2B 中,标题也密集地鹦鹉式(拼写)复述图像中嵌入的文本。我们的分析显示,约 50% 的图像嵌入了视觉文本内容,且约 30% 的标题词汇位于这些嵌入的视觉内容中。基于这一观察,我们彻底检查了不同版本的已发布 CLIP 模型,并证实视觉文本是衡量这些模型 LAION 风格图像 - 文本相似性的主导因素。为了检验这些鹦鹉式标题是否塑造了文本识别偏差,我们使用根据不同鹦鹉式标题导向标准策划的 LAION 子集训练了一系列 CLIP 模型。我们表明,使用鹦鹉式标题进行训练很容易塑造这种偏差,但会损害 CLIP 模型中预期的视觉 - 语言表示学习。这表明,亟需重新审视类 CLIP 模型的设计,或建立在 CLIP 分数过滤基础上的现有图像 - 数据集策划流程。

关键词

引用

@article{arxiv.2312.14232,
  title  = {Parrot Captions Teach CLIP to Spot Text},
  author = {Yiqi Lin and Conghui He and Alex Jinpeng Wang and Bin Wang and Weijia Li and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2312.14232},
  year   = {2024}
}

备注

project page: https://linyq17.github.io/CLIP-Parrot-Bias/. Add more analysis and ablation studies. Update Figure 3 with a more precise metric