利用句法在自然图像中定位指代表达式
计算机视觉与模式识别
2018-05-29 v1 计算与语言
神经与进化计算
摘要
我们提出 GroundNet,一种用于指代表达式识别的神经网络——该任务是在图像中定位(或接地)由自然语言表达式所指的对象。我们处理该任务的方法是首个依赖对输入指代表达式进行句法分析以指导计算图结构的方法。给定输入表达式的解析树,我们显式地将树中存在的句法成分与关系映射到一个由神经模块组成的组合图,该图定义了我们执行定位的架构。这种基于句法的方法有助于定位表达式中提及的目标对象\emph{和}辅助支持对象。因此,GroundNet 比先前方法更具可解释性:我们可以(1)确定指代表达式的哪个短语指向图像中的哪个对象,以及(2)追踪目标对象的定位如何由网络确定。我们通过在 GoogleRef 数据集上引入一组新标注以评估支持对象定位,从而在经验上研究了该性质。我们的实验表明,GroundNet 在识别支持对象方面达到了最先进精度,同时在目标对象定位上保持可比性能。
引用
@article{arxiv.1805.10547,
title = {Using Syntax to Ground Referring Expressions in Natural Images},
author = {Volkan Cirik and Taylor Berg-Kirkpatrick and Louis-Philippe Morency},
journal= {arXiv preprint arXiv:1805.10547},
year = {2018}
}
备注
AAAI 2018