中文

利用多模态表示中的视觉-语言知识进行视觉关系检测

计算机视觉与模式识别 2021-04-06 v3 人工智能 计算与语言 机器学习

摘要

视觉关系检测旨在推理图像中显著物体之间的关系,近年来受到越来越多的关注。受人类推理机制的启发,人们认为外部视觉常识知识有益于推理图像中物体的视觉关系,然而现有方法很少考虑这一点。本文提出一种名为关系型视觉-语言双向编码器表示从 Transformer (RVL-BERT) 的新方法,该方法利用通过多模态表示自监督预训练学到的视觉与语言常识知识进行关系推理。RVL-BERT 还使用有效的空间模块和一种新颖的掩码注意力模块来显式捕捉物体间的空间信息。此外,我们的模型通过直接输入物体名称将物体检测与视觉关系识别解耦,使其能够在任意物体检测系统之上使用。我们通过定量与定性实验表明,借助迁移的知识和新颖模块,RVL-BERT 在两个具有挑战性的视觉关系检测数据集上取得了有竞争力的结果。源代码见 https://github.com/coldmanck/RVL-BERT。

关键词

引用

@article{arxiv.2009.04965,
  title  = {Visual Relationship Detection with Visual-Linguistic Knowledge from Multimodal Representations},
  author = {Meng-Jiun Chiou and Roger Zimmermann and Jiashi Feng},
  journal= {arXiv preprint arXiv:2009.04965},
  year   = {2021}
}

备注

Published in IEEE Access