学习组合与推理语言树结构以实现视觉定位
计算机视觉与模式识别
2019-06-06 v1
摘要
将自然语言定位到图像中,例如定位“树左边那只黑狗”,是人工智能的核心问题之一,因为它需要理解细粒度且组合性的语言空间。然而,现有方案依赖于整体语言特征与视觉特征之间的关联,却忽视了语言本身蕴含的组合推理本质。本文提出一种自然语言定位模型,可自动组合二叉树的树结构来解析语言,并沿树以自底向上的方式执行视觉推理。我们称该模型为 RVG-TREE:递归定位树,其灵感源于任何语言表达都可递归分解为两个组成部分,且定位置信度分数可通过计算子树返回的定位分数递归累积。RVG-TREE 可使用 Straight-Through Gumbel-Softmax 估计器进行端到端训练,该估计器允许来自连续分数函数的梯度穿过离散树构建过程。在多个基准上的实验表明,我们的模型以更具可解释性的推理取得了最先进的性能。
引用
@article{arxiv.1906.01784,
title = {Learning to Compose and Reason with Language Tree Structures for Visual Grounding},
author = {Richang Hong and Daqing Liu and Xiaoyu Mo and Xiangnan He and Hanwang Zhang},
journal= {arXiv preprint arXiv:1906.01784},
year = {2019}
}
备注
Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (T-PAMI)