中文

KVL-BERT:用于视觉常识推理的知识增强视觉-语言 BERT

人工智能 2020-12-15 v1 计算与语言

摘要

推理是实现完整视觉理解的关键能力。为发展具备认知水平视觉理解与推理能力的机器,视觉常识推理(VCR)任务被提出。在 VCR 中,给定关于图像的有挑战性问题,机器必须正确作答并给出证明其答案合理性的依据。采用强大的 BERT 模型作为骨干来学习图像内容与自然语言联合表示的方法已在 VCR 上展现出可喜的改进。然而,现有方法均未在视觉常识推理中利用常识知识,我们认为这将对本任务大有助益。在常识知识支持下,即便所需信息未描绘于图像中,复杂问题也可通过认知推理作答。因此,我们将常识知识引入跨模态 BERT,并提出一种新颖的知识增强视觉-语言 BERT(简称 KVL-BERT)模型。除将视觉与语言内容作为输入外,从 ConceptNet 抽取的外部常识知识被整合进多层 Transformer。为保留原句子的结构信息与语义表示,我们提出使用相对位置嵌入与掩码自注意力来削弱注入的常识知识与该输入序列中其他不相关组件之间的影响。相较于其他任务特定模型与通用任务无关预训练模型,我们的 KVL-BERT 以较大优势超越它们。

关键词

引用

@article{arxiv.2012.07000,
  title  = {KVL-BERT: Knowledge Enhanced Visual-and-Linguistic BERT for Visual Commonsense Reasoning},
  author = {Dandan Song and Siyi Ma and Zhanchen Sun and Sicheng Yang and Lejian Liao},
  journal= {arXiv preprint arXiv:2012.07000},
  year   = {2020}
}