中文

COVR:基于真实图像的视觉接地组合泛化测试平台

计算与语言 2021-09-23 v1

摘要

尽管近年来对测试时泛化到新组合的模型兴趣渐增,但视觉接地领域的基准迄今仍局限于合成图像。本文中,我们提出COVR,一个基于真实图像的视觉接地组合泛化新测试平台。为创建COVR,我们使用带场景图标注的真实图像,并提出一种几乎全自动的程序来生成问答对及一组上下文图像。COVR聚焦于需要复杂推理的问题,包括量化与聚合等高阶操作。由于自动生成过程,COVR便于创建组合切分,其中模型在测试时需以零样本或少样本设置泛化到新概念与组合。我们利用COVR构建组合切分,并展示了大量最先进的预训练语言-视觉模型难以进行组合泛化的情形。

关键词

引用

@article{arxiv.2109.10613,
  title  = {COVR: A test-bed for Visually Grounded Compositional Generalization with real images},
  author = {Ben Bogin and Shivanshu Gupta and Matt Gardner and Jonathan Berant},
  journal= {arXiv preprint arXiv:2109.10613},
  year   = {2021}
}

备注

EMNLP 2021