中文

用于视觉问答推理的语言驱动图胶囊网络

计算机视觉与模式识别 2020-03-24 v1

摘要

近来,视觉问答研究探索了多种端到端网络架构,并在自然与合成数据集上取得有前景的结果,这些任务需要显式的组合推理。然而,有观点认为这些黑盒方法缺乏结果的可解释性,并因过拟合数据集偏置而无法在泛化任务上表现良好。本工作中,我们旨在结合双方优势并克服其局限,实现无需布局标注的通用图像端到端可解释结构推理。受胶囊网络可在常规卷积神经网络(CNN)内部刻画树结构这一特性的启发,我们提出一种称为“语言驱动图胶囊网络”的层次组合推理模型,其中组合过程由语言解析树引导。具体而言,我们将最底层每个胶囊绑定以桥接原问题中单词的语言嵌入与视觉证据,若它们在解析树中为兄弟节点则将其路由至同一胶囊。该组合过程通过在语言驱动条件随机场(CRF)上执行推断实现,并跨多个图胶囊层进行,从而在 CNN 内部产生组合推理过程。在 CLEVR 数据集、CLEVR 组合生成测试及 FigureQA 数据集上的实验证明了我们端到端模型的有效性与组合泛化能力。

关键词

引用

@article{arxiv.2003.10065,
  title  = {Linguistically Driven Graph Capsule Network for Visual Question Reasoning},
  author = {Qingxing Cao and Xiaodan Liang and Keze Wang and Liang Lin},
  journal= {arXiv preprint arXiv:2003.10065},
  year   = {2020}
}

备注

Submitted to TPAMI 2020. We have achieved an end-to-end interpretable structural reasoning for general images without the requirement of layout annotations