中文

利用对抗网络生成三元组以构建场景图

计算机视觉与模式识别 2018-02-09 v1

摘要

受深度学习成功的推动,计算机视觉研究已开始超越目标检测与图像分类,转向图像描述或视觉问答等更复杂的任务。推动此类努力的是模型不仅捕捉图像中存在的物体、还捕捉场景更细粒度方面(如物体间关系及其属性)的诉求。场景图提供了捕捉图像这些方面的形式化结构。尽管如此,从图像生成场景图的近期努力寥寥。以往工作局限于训练时可用边界框信息的设定,且未尝试生成带属性的场景图。本文中,我们基于生成对抗网络的最新进展,提出一种克服这些缺陷的方法。我们采取先生成小 subgraphs(子图)的方式,每个子图使用注意力机制从输入图像特定区域选择、描述场景的一条陈述。由此,我们的方法能够在无需边界框标签的情况下生成带属性信息的场景图部分。然后,由这些子图构建完整场景图。我们表明,在公认指标和前沿数据集上,我们的模型在场景图生成上优于先前工作。此外,我们证明我们的模型能处理比先前工作尝试过的更大词表规模。

关键词

引用

@article{arxiv.1802.02598,
  title  = {Generating Triples with Adversarial Networks for Scene Graph Construction},
  author = {Matthew Klawonn and Eric Heim},
  journal= {arXiv preprint arXiv:1802.02598},
  year   = {2018}
}

备注

Accepted to AAAI 2018