中文

从图像描述与边界框中学习关系推断

计算机视觉与模式识别 2019-12-03 v1 计算与语言 机器学习

摘要

在这项工作中,我们提出了一种新颖的方法,以弱监督方式预测图像中各种实体之间的关系,仅以图像描述与物体边界框标注作为唯一的监督来源。我们提出的方法使用自顶向下的注意力机制将描述中的实体与图像中的物体对齐,然后利用描述的句法结构对齐关系。我们利用这些对齐来训练一个关系分类网络,从而获得接地化的描述与稠密关系。我们在 Visual Genome 数据集上展示了模型的有效性,在图像中存在的关系上取得了 recall@50 为 15% 与 recall@100 为 25% 的召回率。我们还表明,该模型能成功预测相应描述中未出现的关系。

关键词

引用

@article{arxiv.1912.00311,
  title  = {Learning to Relate from Captions and Bounding Boxes},
  author = {Sarthak Garg and Joel Ruben Antony Moniz and Anshu Aviral and Priyatham Bollimpalli},
  journal= {arXiv preprint arXiv:1912.00311},
  year   = {2019}
}

备注

ACL 2019