中文

学习组合与推理语言树结构以实现视觉定位

计算机视觉与模式识别 2019-06-06 v1

摘要

将自然语言定位到图像中,例如定位“树左边那只黑狗”,是人工智能的核心问题之一,因为它需要理解细粒度且组合性的语言空间。然而,现有方案依赖于整体语言特征与视觉特征之间的关联,却忽视了语言本身蕴含的组合推理本质。本文提出一种自然语言定位模型,可自动组合二叉树的树结构来解析语言,并沿树以自底向上的方式执行视觉推理。我们称该模型为 RVG-TREE:递归定位树,其灵感源于任何语言表达都可递归分解为两个组成部分,且定位置信度分数可通过计算子树返回的定位分数递归累积。RVG-TREE 可使用 Straight-Through Gumbel-Softmax 估计器进行端到端训练,该估计器允许来自连续分数函数的梯度穿过离散树构建过程。在多个基准上的实验表明,我们的模型以更具可解释性的推理取得了最先进的性能。

关键词

引用

@article{arxiv.1906.01784,
  title  = {Learning to Compose and Reason with Language Tree Structures for Visual Grounding},
  author = {Richang Hong and Daqing Liu and Xiaoyu Mo and Xiangnan He and Hanwang Zhang},
  journal= {arXiv preprint arXiv:1906.01784},
  year   = {2019}
}

备注

Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (T-PAMI)