CREPE:视觉-语言基础模型能否进行组合性推理?
计算与语言
2023-05-17 v3 计算机视觉与模式识别
摘要
人类视觉与自然语言共有的一个基本特征是其组合性本质。然而,尽管大规模视觉与语言预训练带来了性能提升,我们发现:在海量数据集上以4种算法训练的7种架构,均难以应对组合性。为得出此结论,我们引入新的组合性评测基准CREPE,其衡量认知科学文献所标识的组合性两个重要方面:系统性与生产性。为衡量系统性,CREPE包含一个含逾图文对及三种不同已见-未见划分的测试数据集。这三种划分旨在测试在CC-12M、YFCC-15M与LAION-400M三个流行训练集上训练的模型。我们还为部分配对生成、与条困难负例描述。为测试生产性,CREPE含具九种不同复杂度的图文对,以及带原子、交换与否定干扰项的困难负例描述。数据集通过改造Visual Genome场景图与区域描述,并应用手工模板与GPT-3生成。对于系统性,我们发现当新颖组合主导检索集时模型性能一致下降,Recall@1最高跌。对于生产性,模型检索成功率随复杂度增加而衰减,常在高层度逼近随机水平。这些结果独立于模型与训练数据集规模成立。
引用
@article{arxiv.2212.07796,
title = {CREPE: Can Vision-Language Foundation Models Reason Compositionally?},
author = {Zixian Ma and Jerry Hong and Mustafa Omer Gul and Mona Gandhi and Irena Gao and Ranjay Krishna},
journal= {arXiv preprint arXiv:2212.07796},
year = {2023}
}
备注
Updated figures and numbers