中文

透过词语看世界:在计数任务上测试预训练视觉与语言模型的跨模态能力

计算机视觉与模式识别 2021-06-18 v4 计算与语言

摘要

我们研究了预训练视觉与语言(V&L)模型在两项需要多模态整合的任务中的推理能力:(1)从错误的图像-句子对中判别正确的图像-句子对,(2)计数图像中的实体。我们在零样本和微调设置下,对三种预训练 V&L 模型进行评估:ViLBERT、ViLBERT 12-in-1 和 LXMERT。我们的结果显示,正如预期,模型在任务(1)上表现非常好,因为所有模型都在任务(1)上进行了预训练。然而,没有一种预训练 V&L 模型能够充分解决任务(2)(我们的计数探测任务),并且它们无法泛化到分布外的数量。我们为这些发现提出了若干解释:LXMERT(在某种程度上还有 ViLBERT 12-in-1)在任务(1)上表现出灾难性遗忘的一些证据。关于我们在计数探测任务上的结果,我们发现证据表明所有模型都受到数据集偏差的影响,并且也未能对视觉输入中的实体进行个体区分。尽管预训练 V&L 模型的一个卖点是其解决复杂任务的能力,我们的发现表明,理解其推理和接地能力需要对特定现象进行更有针对性的研究。

关键词

引用

@article{arxiv.2012.12352,
  title  = {Seeing past words: Testing the cross-modal capabilities of pretrained V&L models on counting tasks},
  author = {Letitia Parcalabescu and Albert Gatt and Anette Frank and Iacer Calixto},
  journal= {arXiv preprint arXiv:2012.12352},
  year   = {2021}
}

备注

Paper accepted for publication at MMSR 2021; 13 pages, 3 figures, 7 Tables