中文

学习组装神经模块树网络用于视觉定位

计算机视觉与模式识别 2019-10-22 v3

摘要

视觉定位是一项将自然语言在图像中定位(即局部化)的任务,本质上需要进行复合视觉推理。然而,现有方法将语言的复合性质过度简化为单一的句子嵌入或主体-谓词-客体三元组的粗略组合。在本文中,我们提出以直观、可解释且复合的方式(正如其应有的那样)对自然语言进行定位。具体而言,我们开发了一种称为神经模块树网络(NMTree)的新型模块化网络,它沿着句子的依存解析树对视觉定位进行正则化,其中每个节点是一个根据其语言特征计算视觉注意力的神经模块,定位分数在自底向上的方向上按需累积。NMTree将视觉定位与复合推理解耦,使前者仅关注原始且易于泛化的模式。为减少解析错误的影响,我们使用Gumbel-Softmax近似及其直通梯度估计器对模块及其组装进行端到端训练,以考虑模块组装的离散性质。总体而言,所提出的NMTree在多个基准上持续优于当前最优(SOTA)方法。定性结果显示了极为细致的可解释定位分数计算。

关键词

引用

@article{arxiv.1812.03299,
  title  = {Learning to Assemble Neural Module Tree Networks for Visual Grounding},
  author = {Daqing Liu and Hanwang Zhang and Feng Wu and Zheng-Jun Zha},
  journal= {arXiv preprint arXiv:1812.03299},
  year   = {2019}
}

备注

Accepted at ICCV 2019 (Oral); Code available at https://github.com/daqingliu/NMTree