中文

将语言结构作为弱监督用于视觉场景图生成

计算机视觉与模式识别 2021-05-31 v1

摘要

先前场景图生成的工作需要在三元组层面提供类别监督——主体与客体,以及关联它们的谓词,无论是否带有边界框信息。然而,场景图生成是一项整体性任务:因此直觉上整体性的、上下文的监督应能提升性能。本工作中,我们探索图像描述中的语言结构如何裨益场景图生成。我们的方法捕捉描述中关于个体三元组间关系的信息,以及主体与客体的上下文(例如提及视觉属性)。描述是比三元组更弱的一类监督,因为三元组中详尽人工标注的主体与客体列表,与描述中的名词之间的对齐是弱的。然而,鉴于网络上大量且多样的多模态数据源(例如带图像与描述的博客文章),语言监督比众包三元组更具可扩展性。我们展示了与利用实例级与图像级监督的已有方法的广泛实验对比,并对我们的方法做消融实验以显示利用短语与序列上下文、以及改进主体与客体定位技术的影响。

关键词

引用

@article{arxiv.2105.13994,
  title  = {Linguistic Structures as Weak Supervision for Visual Scene Graph Generation},
  author = {Keren Ye and Adriana Kovashka},
  journal= {arXiv preprint arXiv:2105.13994},
  year   = {2021}
}

备注

To appear in CVPR 2021