使用组合模块网络建模指代表达式中的关系
计算机视觉与模式识别
2016-12-01 v1
摘要
人们经常根据图像中实体与其他实体的关系来指代该实体。例如,“桌子底下坐着的黑猫”既指代一个“黑猫”实体,也指代其与另一个“桌子”实体的关系。理解这些关系对于解释和定位此类自然语言表达式至关重要。以往的大多数工作要么将整个指代表达式整体定位到一个区域,要么基于固定的类别集合来定位关系。在本文中,我们提出了一种模块化深度架构,能够将指代表达式解析为其组成部分,识别输入表达式中提及的实体和关系,并将它们全部定位到场景中。我们将这种方法称为组合模块网络:一种端到端学习语言分析与视觉推理的新颖架构。我们的方法围绕两类神经模块构建,这些模块检查局部区域以及区域之间的成对交互。我们在多个指代表达式数据集上评估了 CMN,在所有任务上均优于 SOTA 方法。
引用
@article{arxiv.1611.09978,
title = {Modeling Relationships in Referential Expressions with Compositional Modular Networks},
author = {Ronghang Hu and Marcus Rohrbach and Jacob Andreas and Trevor Darrell and Kate Saenko},
journal= {arXiv preprint arXiv:1611.09978},
year = {2016}
}