COVR:基于真实图像的视觉接地组合泛化测试平台
计算与语言
2021-09-23 v1
摘要
尽管近年来对测试时泛化到新组合的模型兴趣渐增,但视觉接地领域的基准迄今仍局限于合成图像。本文中,我们提出COVR,一个基于真实图像的视觉接地组合泛化新测试平台。为创建COVR,我们使用带场景图标注的真实图像,并提出一种几乎全自动的程序来生成问答对及一组上下文图像。COVR聚焦于需要复杂推理的问题,包括量化与聚合等高阶操作。由于自动生成过程,COVR便于创建组合切分,其中模型在测试时需以零样本或少样本设置泛化到新概念与组合。我们利用COVR构建组合切分,并展示了大量最先进的预训练语言-视觉模型难以进行组合泛化的情形。
引用
@article{arxiv.2109.10613,
title = {COVR: A test-bed for Visually Grounded Compositional Generalization with real images},
author = {Ben Bogin and Shivanshu Gupta and Matt Gardner and Jonathan Berant},
journal= {arXiv preprint arXiv:2109.10613},
year = {2021}
}
备注
EMNLP 2021