中文

预训练单模态与多模态模型中的视觉常识

计算与语言 2022-05-05 v1 计算机视觉与模式识别

摘要

我们对物体的常识知识包括其典型的视觉属性;我们知道香蕉通常是黄色或绿色,而非紫色。文本语料库和图像语料库受报道偏差影响,对这类世界知识的呈现忠实程度不一。本文研究了单模态(仅语言)和多模态(图像与语言)模型在多大程度上捕捉了广泛的视觉显著属性。为此,我们创建了视觉常识测试(ViComTe)数据集,涵盖超过 5000 个主体的 5 种属性类型(颜色、形状、材质、尺寸和视觉共现)。我们通过表明我们的接地颜色数据比未接地的纯文本数据更好地与 Paik 等人(2021)提供的众包颜色判断相关联,从而验证了该数据集。随后我们使用该数据集评估预训练单模态模型和多模态模型。我们的结果表明,多模态模型能更好地重建属性分布,但仍受报道偏差影响。此外,增大模型规模并不能提升性能,这表明视觉常识的关键在于数据。

关键词

引用

@article{arxiv.2205.01850,
  title  = {Visual Commonsense in Pretrained Unimodal and Multimodal Models},
  author = {Chenyu Zhang and Benjamin Van Durme and Zhuowan Li and Elias Stengel-Eskin},
  journal= {arXiv preprint arXiv:2205.01850},
  year   = {2022}
}

备注

To appear in NAACL 2022