中文

关于视觉语言组合性的硬性真相

计算与语言 2024-09-27 v1 计算机视觉与模式识别

摘要

多个基准测试得出结论:我们最好的视觉语言模型(如 CLIP)在组合性方面存在不足。这些基准测试会针对给定图像,在一组包含组合干扰项的候选答案中,探测模型识别其关联标题的能力。为此,近期出现了一波通过使用干扰项作为硬负样本进行微调 CLIP 以提升性能的方案。我们的调查发现,这些改进实际上被严重高估了——因为现有基准测试并未探测微调后的视觉语言模型对硬性正样本的不变性。我们构建了包含 112,382 个硬负样本和硬正样本的评估数据集,发现包括硬正样本后,CLIP 的性能下降 12.9%,而人类则轻松做到 99%。使用硬负样本微调的 CLIP 下降幅度更大,最高可达 38.7%。在此基础上,我们制作了一个 1,775,259 张的图像-文本训练集,包含硬负样本和硬正样本。通过同时训练这两者,我们在现有基准测试上取得改进,同时提升了对硬正样本的性能,表明组合性得到更稳健的提升。我们的工作表明,未来的研究需要严格测试和改进 CLIP 对相关“正面”概念之间语义关系的理解能力。

关键词

引用

@article{arxiv.2409.17958,
  title  = {The Hard Positive Truth about Vision-Language Compositionality},
  author = {Amita Kamath and Cheng-Yu Hsieh and Kai-Wei Chang and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2409.17958},
  year   = {2024}
}

备注

ECCV 2024