中文

利用先验知识进行关系推理的视觉描述生成

计算机视觉与模式识别 2019-06-05 v1

摘要

利用对象间关系在自然语言解释图像或视频方面取得了显著进展。大多数现有方法依赖于先检测对象及其关系,再生成文本描述,这严重依赖预训练检测器,并在面对目标检测中的严重遮挡、微小尺寸对象与长尾问题时导致性能下降。此外,检测与描述的分开流程造成了预定义对象/关系类别与目标词汇词之间的语义不一致。我们利用先验人类常识知识推理对象间关系,无需任何预训练检测器,并在图像或视频描述中实现语义连贯。先验知识(例如以知识图形式)提供了图像和视频中未显式的对象间的常识语义关联与约束,作为构建语义图以生成句子的有用引导。特别地,我们提出一种联合推理方法,融合1)将图像或视频区域嵌入语义空间以构建语义图的常识推理,以及2)编码语义图以生成句子的关系推理。在MS-COCO图像描述基准与MSVD视频描述基准上的大量实验验证了我们的方法在利用先验常识知识增强视觉描述关系推理方面的优越性。

关键词

引用

@article{arxiv.1906.01290,
  title  = {Relational Reasoning using Prior Knowledge for Visual Captioning},
  author = {Jingyi Hou and Xinxiao Wu and Yayun Qi and Wentian Zhao and Jiebo Luo and Yunde Jia},
  journal= {arXiv preprint arXiv:1906.01290},
  year   = {2019}
}