中文

ERNIE-ViL:通过场景图实现知识增强的视觉-语言表示

计算机视觉与模式识别 2021-03-22 v3 计算与语言

摘要

我们提出一种知识增强方法 ERNIE-ViL,它利用从场景图中获得的结构化知识来学习视觉与语言的联合表示。ERNIE-ViL 试图构建视觉与语言之间细致的语义关联(对象、对象属性以及对象间关系),这些对于视觉-语言跨模态任务至关重要。利用视觉场景的场景图,ERNIE-ViL 在预训练阶段构建场景图预测任务,即对象预测、属性预测和关系预测任务。具体而言,这些预测任务通过预测从句子解析出的场景图中不同类型的节点来实现。因此,ERNIE-ViL 能够学习刻画视觉与语言间细致语义对齐的联合表示。在大规模图文对齐数据集上预训练后,我们在 5 个跨模态下游任务上验证了 ERNIE-ViL 的有效性。ERNIE-ViL 在所有这些任务上均取得最先进性能,并以 3.7% 的绝对提升在 VCR 排行榜上位居第一。

关键词

引用

@article{arxiv.2006.16934,
  title  = {ERNIE-ViL: Knowledge Enhanced Vision-Language Representations Through Scene Graph},
  author = {Fei Yu and Jiji Tang and Weichong Yin and Yu Sun and Hao Tian and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2006.16934},
  year   = {2021}
}

备注

Paper has been published in the AAAI2021 conference