中文

CREPE:视觉-语言基础模型能否进行组合性推理?

计算与语言 2023-05-17 v3 计算机视觉与模式识别

摘要

人类视觉与自然语言共有的一个基本特征是其组合性本质。然而,尽管大规模视觉与语言预训练带来了性能提升,我们发现:在海量数据集上以4种算法训练的7种架构,均难以应对组合性。为得出此结论,我们引入新的组合性评测基准CREPE,其衡量认知科学文献所标识的组合性两个重要方面:系统性与生产性。为衡量系统性,CREPE包含一个含逾370K370K图文对及三种不同已见-未见划分的测试数据集。这三种划分旨在测试在CC-12M、YFCC-15M与LAION-400M三个流行训练集上训练的模型。我们还为部分配对生成325K325K316K316K309K309K条困难负例描述。为测试生产性,CREPE含17K17K具九种不同复杂度的图文对,以及183K183K带原子、交换与否定干扰项的困难负例描述。数据集通过改造Visual Genome场景图与区域描述,并应用手工模板与GPT-3生成。对于系统性,我们发现当新颖组合主导检索集时模型性能一致下降,Recall@1最高跌12%12\%。对于生产性,模型检索成功率随复杂度增加而衰减,常在高层度逼近随机水平。这些结果独立于模型与训练数据集规模成立。

关键词

引用

@article{arxiv.2212.07796,
  title  = {CREPE: Can Vision-Language Foundation Models Reason Compositionally?},
  author = {Zixian Ma and Jerry Hong and Mustafa Omer Gul and Mona Gandhi and Irena Gao and Ranjay Krishna},
  journal= {arXiv preprint arXiv:2212.07796},
  year   = {2023}
}

备注

Updated figures and numbers