中文

文本编码器在对比视觉-语言模型中制约组合性表达

计算与语言 2023-10-31 v2 计算机视觉与模式识别 机器学习

摘要

诸如 CLIP 这类高性能视觉-语言(VL)模型使用单一向量来表示图像描述。在这一瓶颈中有多少语言信息丢失了?我们首先整理了 CompPrompts,这是一组组合性逐渐增强的图像描述,VL 模型应当能够捕捉这些内容(例如,从单个物体,到物体+属性,再到多个相互作用的物体)。随后,我们训练了仅从文本的还原探针,旨在从多个 VL 模型生成的单向量文本表示中重建描述。该方法不需要图像,使得我们相比先前工作能够在更广泛的场景上进行测试。我们发现:1) CLIP 的文本编码器在更具组合性的输入上表现不足,包括物体关系、属性-物体关联、计数以及否定;2) 某些文本编码器的表现明显优于其他编码器;3) 仅从文本的还原性能能够预测在 ControlledImCaps 上的多模态匹配性能——这是我们收集并发布的一个由细粒度组合性图像与描述组成的新评测基准。具体而言,我们的结果表明,在对比 VL 模型中,仅从文本的还原能力是建模组合性因素的必要(但非充分)条件。我们发布了数据集与代码。

关键词

引用

@article{arxiv.2305.14897,
  title  = {Text encoders bottleneck compositionality in contrastive vision-language models},
  author = {Amita Kamath and Jack Hessel and Kai-Wei Chang},
  journal= {arXiv preprint arXiv:2305.14897},
  year   = {2023}
}

备注

EMNLP 2023